Harvey LAB 批量重评完整指南:如何用 eval-only 快速重新评分现有运行
【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs
Harvey LAB(Legal Agent Benchmark)是用于评估 AI Agent 法律工作能力的开源基准,内置 1600+ 真实法律任务。跑完一轮 Agent 之后,如果你想换裁判模型、更新评分细则或补跑遗漏的打分,无需重新让 Agent 干活——sweep 工具的eval-only 模式可以批量重评现有运行,省时又省钱。
💡 什么时候需要批量重评?
Agent 跑一次可能耗费数小时与大量 token。但"评分"本身是独立的阶段,以下场景你只需要重新评分,而不是重跑 Agent:
- 更换或升级裁判模型:想让
gpt-5.5或更强的模型重新当裁判 - 更新了 task.json 中的 rubric 细则:评分标准变了,旧分数作废
- 补分:上次 sweep 中断,部分运行只有
metrics.json没有scores.json - 验证评分稳定性:同一份产出用不同裁判再评一遍
🏗️ 先看懂三阶段流水线
sweep 工具把一次完整基准拆成三个阶段(实现见 utils/sweep.py):
| 阶段 | 内容 | eval-only 是否执行 |
|---|---|---|
| Phase 1 | Agent 跑任务,产出文档 | ❌ 跳过 |
| Phase 2 | LLM 裁判逐条打分 | ✅ 只跑这里 |
| Phase 3 | 生成单份报告 + 对比看板 | ✅ 照常执行 |
也就是说,--eval-only会直接跳过 Phase 1,从已有的results/目录中挑出完成的运行重新送评。
🚀 一条命令启动批量重评
uv run python utils/sweep.py --task corporate-ma --eval-only--task支持任务 ID、业务领域或all,例如重评全部任务:
uv run python utils/sweep.py --task all --eval-only --parallel 8📌 相关 CLI 参考详见 docs/tutorial.md 的 "CLI Reference" 附录,兼容性入口 scripts/run_model_sweep.py 也可用。
⚙️ 重评是怎么选运行、打分的?
1. 找"最新一次完成运行"每个"模型×任务"配置下,工具会扫描results/中带metrics.json的时间戳子目录,取最新一个作为重评对象(逻辑在 utils/sweep.py 的find_latest_run函数)。
2. 已打分的自动跳过若该运行已存在scores.json,直接 SKIP,不会重复消耗裁判 API 配额。想强制全部重评?先移开或删除旧的scores.json即可。
3. 裁判逐条评分实际打分由 evaluation/run_eval.py 完成:裁判模型(默认claude-sonnet-4-6,可用--judge-model更换)按 evaluation/prompts/rubric_criterion.txt 模板逐条评判,采用全过制(all-pass)——所有细则都通过才计 1 分。评分细节见 docs/eval-strategies.md。
📊 重评之后:自动刷新报告
Phase 3 会为每个配置重新生成单份 HTML 报告,并刷新多模型对比看板(evaluation/compare.py),你就能看到不同模型在不同推理档位下的all-pass 率与细则通过率对比。
🧰 进阶技巧
- 只想重生报告不重评:
--report-only - 先看看会做什么:加
--dry-run预览计划,不动任何模型 - 只跑预检:
--preflight-only校验任务加载与 rubric 是否齐全 - 单份产出双裁判重评:
uv run python -m evaluation.run_eval --run-id <run_id> --task <task> --dual会用标准裁判组(Sonnet + GPT-5.5)分别独立打分并取均值,结果写入
scores_dual.json - 目录布局迁移:旧版"模型优先"目录结构可用 scripts/remap_results.py 一键重映射为"任务优先"布局,支持
--dry-run预演
❓ 常见问题
Q:eval-only 会给新运行的模型打分吗?不会。它只对results/中已存在的完成运行(有metrics.json)评分,没有任何产出的配置会被跳过。
Q:裁判和 Agent 可以是同一个模型吗?技术上可以,但不建议——建议裁判与参赛选手错开,保证评分中立。
Q:并行度怎么定?裁判阶段受 API 限流约束,sweep 内部会自动把并行度压到 4~8,一般无需手动调。
掌握--eval-only,你就拥有了"只重考、不重做"的能力——这是把 Harvey LAB 用成持续迭代工具的关键一步。 🎯
【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考