Harvey LAB 批量重评完整指南:如何用 eval-only 快速重新评分现有运行
2026/9/21 2:40:54 网站建设 项目流程

Harvey LAB 批量重评完整指南:如何用 eval-only 快速重新评分现有运行

【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs

Harvey LAB(Legal Agent Benchmark)是用于评估 AI Agent 法律工作能力的开源基准,内置 1600+ 真实法律任务。跑完一轮 Agent 之后,如果你想换裁判模型、更新评分细则或补跑遗漏的打分,无需重新让 Agent 干活——sweep 工具的eval-only 模式可以批量重评现有运行,省时又省钱。

💡 什么时候需要批量重评?

Agent 跑一次可能耗费数小时与大量 token。但"评分"本身是独立的阶段,以下场景你只需要重新评分,而不是重跑 Agent:

  • 更换或升级裁判模型:想让gpt-5.5或更强的模型重新当裁判
  • 更新了 task.json 中的 rubric 细则:评分标准变了,旧分数作废
  • 补分:上次 sweep 中断,部分运行只有metrics.json没有scores.json
  • 验证评分稳定性:同一份产出用不同裁判再评一遍

🏗️ 先看懂三阶段流水线

sweep 工具把一次完整基准拆成三个阶段(实现见 utils/sweep.py):

阶段内容eval-only 是否执行
Phase 1Agent 跑任务,产出文档❌ 跳过
Phase 2LLM 裁判逐条打分✅ 只跑这里
Phase 3生成单份报告 + 对比看板✅ 照常执行

也就是说,--eval-only直接跳过 Phase 1,从已有的results/目录中挑出完成的运行重新送评。

🚀 一条命令启动批量重评

uv run python utils/sweep.py --task corporate-ma --eval-only

--task支持任务 ID、业务领域或all,例如重评全部任务:

uv run python utils/sweep.py --task all --eval-only --parallel 8

📌 相关 CLI 参考详见 docs/tutorial.md 的 "CLI Reference" 附录,兼容性入口 scripts/run_model_sweep.py 也可用。

⚙️ 重评是怎么选运行、打分的?

1. 找"最新一次完成运行"每个"模型×任务"配置下,工具会扫描results/中带metrics.json的时间戳子目录,取最新一个作为重评对象(逻辑在 utils/sweep.py 的find_latest_run函数)。

2. 已打分的自动跳过若该运行已存在scores.json,直接 SKIP,不会重复消耗裁判 API 配额。想强制全部重评?先移开或删除旧的scores.json即可。

3. 裁判逐条评分实际打分由 evaluation/run_eval.py 完成:裁判模型(默认claude-sonnet-4-6,可用--judge-model更换)按 evaluation/prompts/rubric_criterion.txt 模板逐条评判,采用全过制(all-pass)——所有细则都通过才计 1 分。评分细节见 docs/eval-strategies.md。

📊 重评之后:自动刷新报告

Phase 3 会为每个配置重新生成单份 HTML 报告,并刷新多模型对比看板(evaluation/compare.py),你就能看到不同模型在不同推理档位下的all-pass 率细则通过率对比。

🧰 进阶技巧

  • 只想重生报告不重评--report-only
  • 先看看会做什么:加--dry-run预览计划,不动任何模型
  • 只跑预检--preflight-only校验任务加载与 rubric 是否齐全
  • 单份产出双裁判重评
    uv run python -m evaluation.run_eval --run-id <run_id> --task <task> --dual

    会用标准裁判组(Sonnet + GPT-5.5)分别独立打分并取均值,结果写入scores_dual.json

  • 目录布局迁移:旧版"模型优先"目录结构可用 scripts/remap_results.py 一键重映射为"任务优先"布局,支持--dry-run预演

❓ 常见问题

Q:eval-only 会给新运行的模型打分吗?不会。它只对results/中已存在的完成运行(有metrics.json)评分,没有任何产出的配置会被跳过。

Q:裁判和 Agent 可以是同一个模型吗?技术上可以,但不建议——建议裁判与参赛选手错开,保证评分中立。

Q:并行度怎么定?裁判阶段受 API 限流约束,sweep 内部会自动把并行度压到 4~8,一般无需手动调。

掌握--eval-only,你就拥有了"只重考、不重做"的能力——这是把 Harvey LAB 用成持续迭代工具的关键一步。 🎯

【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询