内容提要
Anthropic公开AI研发内部指标:Claude在26%研发任务中达“主导”级,约3万Agent并行,超10亿次决策仅0.002%被在线阻止。文章认为关键不是自动化比例,而应结合监控覆盖率、坏行为检出率与人工响应时延综合评估,并公开算力分配,避免“覆盖率崇拜”。
延伸解读
自动化比例为何不能单独看
文章指出,Claude在26%的研发任务中达到“主导”级别,但这一比例只说明AI做了多少,不说明做得对不对。若只看自动化率,可能忽略监督是否有效、坏行为能否被检出。真正有意义的评估需要把任务自动化等级、监控覆盖率、已知坏行为检出率和人工响应时延连起来看,否则容易产生虚假的安全感。
监督覆盖率的局限与风险
Anthropic公开的数据显示,约3万个Agent并行,所有动作都经过在线和事后监控,但100%覆盖只证明管道没有绕过检查,不等于检查器能理解每个动作的上下文。文章提醒警惕“覆盖率崇拜”,并建议用独立红队在固定攻击集上的检出率来检验监督有效性,同时记录规则更新前后的回归测试结果。
算力分配是缺失的拼图
文章认为,模型能力评测属于输出,训练和研究算力属于投入。只有长期记录训练、推理、自动化研发和安全评估各占多少资源,外部人才可能判断进展速度与安全投入是否同步。但本次公开对前两组指标给出了更具体的快照,跨实验室可比的算力口径仍有待形成,这是当前公开信息的一个明显缺口。
对开发团队的落地启示
这套框架不只适用于前沿实验室。使用编码Agent的团队可以按周回答四个问题:多少任务由AI建议、协作或端到端完成;哪些工具动作必经策略检查;被拦截的动作多久有人复核;红队样本的召回率是多少。文章以数据库迁移为例,说明应区分“协作”与“主导”,否则使用率增长无法说明风险如何变化。
Q&A
Anthropic公开了哪些内部AI研发指标?
Anthropic公开了三组内部测量:AI参与研发的程度(AL0到AL5六级)、Agent行动如何被监督(约3万个Agent并行,超10亿次决策仅0.002%被在线阻止)、计算资源怎样分配。
为什么说自动化比例不是评估AI研发安全的关键?
自动化比例只告诉我们AI做了多少,不告诉我们做得对不对。监督覆盖率只说明动作经过了检查,不等于检查器能识别危险。阻止率也不是越低越安全,可能意味着行为更稳,也可能意味着规则太松。真正有意义的是把任务自动化等级、监控覆盖率、已知坏行为的检出率、人工响应时延四个量连起来看。
Anthropic的AI研发自动化等级AL0到AL5分别代表什么?
AL3代表AI在紧密人类指导下完成大块工作,AL4代表它能从高层目标出发主导大部分任务,人类负责监督;AL5才是无人介入的完全自主。截至2026年8月,Claude尚未在任何已测研发子集中达到AL5,但在26%的AI研发工作中达到“主导”级别,达到“协作或以上”的占比超过90%。
开发团队如何借鉴Anthropic的框架来评估自己的AI使用?
团队可以按周回答四个问题:多少任务由AI建议、协作或端到端完成;哪些工具动作必经策略检查;被拦截的动作多久有人复核;红队样本的召回率是多少。例如数据库迁移中,AI生成脚本但生产执行由人批准属于“协作”;如果Agent能根据目标完成备份、灰度、验证和回滚方案,人只检查关键闸门,更接近“主导”。
为什么说“覆盖率崇拜”是危险的?
100%的动作经过在线监控,只能证明管道没有绕过检查,不能证明检查器理解每个动作的上下文。未来最值得公开的是独立红队在固定攻击集上的检出率,以及规则更新前后是否用同一批样本回归测试。没有这一层,覆盖率只是系统接线图,不是安全成绩单。
Anthropic公开的数据有哪些局限性?
这些数字目前主要由Anthropic自行定义和测量,且只覆盖其最常用平台,不代表全部研发活动。官方也承认用自家模型评判自家Agent可能共享盲点,并计划引入第三方评估者。26%不能被解读为“26%的科学家已被替代”,任务粒度、抽样方式、主导的判定规则都会改变结果。约3万个并发Agent也不等于3万名全职员工。
文章建议的审计清单包括哪些具体步骤?
先定义任务单位,再统计AI建议、协作、主导和自主的占比;把“动作经过检查”与“检查能抓住多少已知坏行为”分开报告;记录在线阻止、离线标记、人工升级和最终确认的完整漏斗;同时报告复核时延;保存模型、策略和工具版本;每月用人工设计的攻击样本测一次监控召回率。