/** * darwin eval --tasks * * Offline eval: run stored prompt versions (or all of them) over a frozen * task set, score each output with the built-in critic, and print/write a * per-task comparison table with arm deltas against the baseline. * * darwin eval writer --tasks tasks.json # active version vs v1 * darwin eval writer --tasks tasks.json --versions v1,v3 * darwin eval writer --tasks tasks.json --all-versions --runs 3 * darwin eval writer --tasks tasks.json --dry # wiring check, 0 LLM calls * * Task-set format (JSON): `[{"id": "t1", "type": "tech", "task": "..."}, …]` * or `{"tasks": [...]}` — the same shape as `benchmark/seed-tasks.json`. */ interface EvalFlags { agentName: string; tasksPath?: string; /** Explicit version labels (`--versions v1,v3`). */ versions?: string[]; allVersions: boolean; runsPerCell: number; json: boolean; dry: boolean; } export declare function parseEvalArgs(args: string[]): EvalFlags; export declare function evalCommand(args: string[]): Promise; export {}; //# sourceMappingURL=eval.d.ts.map