Harvey LAB是法律AI公司Harvey开源的基准,含1660个任务和约10.1万条评分判据,覆盖24个执业领域。任务在沙箱中执行,采用文件系统优先设计,通过LLM评审逐条裁决,使用all-pass评分(差一条判据整题零分)。该基准模拟真实律师工作,但存在评审模型亲缘偏差、判据质量依赖作者功力等局限。
完成下面两步后,将自动完成登录并继续当前操作。