Harvey LAB:法律 Agent 基准的架构与评测方法
内容提要
Harvey LAB是法律AI公司Harvey开源的基准,含1660个任务和约10.1万条评分判据,覆盖24个执业领域。任务在沙箱中执行,采用文件系统优先设计,通过LLM评审逐条裁决,使用all-pass评分(差一条判据整题零分)。该基准模拟真实律师工作,但存在评审模型亲缘偏差、判据质量依赖作者功力等局限。
关键要点
-
Harvey LAB是法律AI公司Harvey开源的基准,包含1,660个任务(本地checkout已有2,010个)、覆盖24个执业领域和约10.1万条评分判据,采用MIT协议。
-
任务模型为文件系统优先:每个任务是一个目录,含task.json和documents/资料室;task.json包含指令、工作类型、交付物映射和评分判据。
-
执行链路刻意做薄:agent循环约百行,最多200轮,工具仅六个(bash、read、write、edit、glob、grep),全部在沙箱内运行。
-
沙箱使用Podman容器,断网、去权,资料室只读挂载,评分细则task.json不进入容器,防止agent偷看。
-
评测方法无标准答案,由LLM评审(默认claude-sonnet-4-6,温度0)逐条裁决,采用all-pass评分:差一条判据整题零分。
-
可选双评审模式(增加gpt-5.5)取平均,缓解单一评审的口味问题。
-
基准存在局限:评审模型亲缘偏差(默认Anthropic模型)、判据质量依赖作者功力、all-pass对判据灌水敏感、跨任务比较需注意判据数量差异、资料室合成且材料齐备、运行成本较高。
延伸解读
文件系统优先的设计哲学
Harvey LAB 采用文件系统优先的架构,任务、结果和报告均以文件形式存储,无数据库和 Web 服务。这种设计简化了部署和调试,便于版本控制和审计。每个任务是一个目录,包含 task.json 和 documents/ 资料室,结构清晰,易于扩展。这种设计也降低了运行门槛,用户只需具备基本的文件操作能力即可运行基准。
沙箱隔离与防作弊机制
每个任务在独立的 Podman 容器中运行,断网、去权,资料室只读挂载,评分细则不进入容器,防止 agent 偷看。这种严格的隔离机制确保了评测的公平性和安全性。恶意构造的文档在容器内解析,不会影响宿主机。系统提示中的违规警告只是第二道防线,物理隔离才是关键。
all-pass 评分的严苛性
Harvey LAB 采用 all-pass 评分,即所有判据必须全部通过,否则整题零分。这种评分方式反映了法律行业对准确性的极高要求:一份遗漏关键风险的报告即使其他部分完美,也是不合格的。这种二值评分虽然严苛,但能有效衡量 agent 在真实任务中的可靠性,避免因部分得分而掩盖实质缺陷。
评测的局限性与成本考量
基准存在评审模型亲缘偏差、判据质量依赖作者功力、all-pass 对判据灌水敏感等局限。此外,资料室为合成数据,材料齐备,与真实世界的混乱场景有差距。运行成本较高,全量评测需大量 API 调用,但支持按领域或任务切片运行,用户可根据需求灵活选择,控制成本。
延伸问答
Harvey LAB是什么?
Harvey LAB是法律AI公司Harvey开源的基准,包含1,660个任务(本地checkout已有2,010个)、覆盖24个执业领域和约10.1万条评分判据,采用MIT协议。它模拟真实律师工作,如尽调、起草、红线、备忘录。
Harvey LAB的任务是如何组织的?
每个任务是一个目录,包含task.json和documents/资料室。task.json包含指令、工作类型(分析/起草/审阅/检索)、交付物映射和评分判据。资料室是合成的案卷材料。
Harvey LAB的沙箱环境是如何设计的?
每个任务在独立的Podman容器中运行,断网(--network=none)、去权(--cap-drop=ALL),资料室只读挂载,只有工作区和交付目录可写。评分细则task.json不进入容器,防止agent偷看。
Harvey LAB如何评测没有标准答案的任务?
由LLM评审(默认claude-sonnet-4-6,温度0)逐条裁决,每条判据独立评审,语义比对,返回pass/fail和理由。采用all-pass评分:差一条判据整题零分。可选双评审模式(增加gpt-5.5)取平均。
Harvey LAB的all-pass评分是什么意思?
all-pass评分是指任务得分是二值的:只有所有判据都通过才得1分,否则得0分。理由是律师工作中漏掉实质风险就是错的,所以差一条判据整题零分。
Harvey LAB存在哪些局限性?
局限包括:评审模型亲缘偏差(默认Anthropic模型)、判据质量依赖作者功力、all-pass对判据灌水敏感、跨任务比较需注意判据数量差异、资料室合成且材料齐备、运行成本较高。
如何运行Harvey LAB的评测?
使用命令如:uv run python -m harness.run --model anthropic/claude-sonnet-4-6 --task real-estate/extract-psa-key-terms/scenario-01,然后运行evaluation.run_eval,最后可用utils.sweep并行跑多个模型。