内容提要
9月14日提交的KnowBench提出用“工作量减少率”(ER)评测临床AI,即AI生成且被医生签署接受的工作单元占比,比文本相似度更贴近真实工作流。其专有模型在百万次就诊中ER达97.99%。但高接受率不等于临床正确或安全,可能受界面、时间压力影响,且不同错误代价差异大。建议同时报告严重错误率、复核时间等,并分层审计。
延伸解读
ER指标的价值与边界
KnowBench提出的工作量减少率(ER)以医生签署接受的工作单元占比来衡量AI实际减轻的编辑负担,比文本相似度更贴近真实工作流。但文章强调,高ER不等于临床正确或安全,可能受界面设计、时间压力和病例选择影响。因此ER最适合回答“系统是否减轻编辑负担”,而非“系统是否足够安全”,不能替代严重错误率和患者结局的评估。
工作单元定义决定可比性
ER的计算高度依赖“工作单元”的划分。若按字段统计,一次微小修改与整段重写能被区分;若按整份文档接受或拒绝,则两者会被混为一谈。文章指出,跨产品比较ER前必须先确认分母相同,否则不同定义下的数字没有可比性。这意味着采用ER时,需先明确单元粒度并保持报告协议一致。
高接受率背后的风险
97.99%的ER来自项目方自有闭环系统,并非独立随机试验。文章提醒,医生因时间压力快速签署时,系统会把行为当作成功,却未必捕捉遗漏或延迟出现的错误。此外,不同错误代价差异巨大,拼写修改与漏掉药物过敏不能各算一个相同单位。因此减负率必须与严重错误率、复核时间、覆盖率和病例复杂度分开报告。
可审计的修改事件更值得采用
文章认为,KnowBench最值得采用的是可审计的修改事件,而非97.99%这个尚缺完整伴随统计的数字。建议同时报告ER、人工复核分钟数、严重错误率、覆盖率与返工率,并对未使用AI的同期样本做基线,随机抽查直接接受的记录,按专科、病例复杂度和医生经验分层。在医疗等高风险场景,不适合用ER自动放宽人工复核。
Q&A
KnowBench提出的工作量减少率(ER)具体是怎么定义的?
ER指在专家和安全审查框架下,系统生成且被责任临床人员签署接受的工作单元,占全部工作单元的比例。不同任务的单元可以是病历段落、诊断和收费编码、医嘱、电子健康记录摘要、患者离院说明或决策支持项;每次修改都被视为返还给医生的剩余工作。
为什么说ER比BLEU等文本相似度指标更接近真实临床工作流?
因为病历可以有多种正确表述,BLEU等参考文本相似度可能惩罚合理改写,而专家打分又昂贵、样本小且难以持续。医生在真实系统中的签署和修改是工作流自然产生的反馈,能回答管理者最关心的问题:AI究竟完成了多少可交付工作,而不是像不像某份模板。
高ER值(如97.99%)能证明临床AI安全有效吗?
不能。高接受率可能来自模型质量,也可能受默认界面、医生时间压力、自动填充范围、专科难度和病例选择影响。若医生因赶时间快速签署,系统会把行为当作成功,却未必捕捉遗漏或延迟出现的错误。而且不同错误代价差异巨大,拼写修改和漏掉药物过敏不能各算一个相同单位。因此减负率必须与严重错误率、复核时间、覆盖率、病例复杂度和患者结局分开报告。
ER指标在门诊摘要场景中如何体现价值?
例如AI正确写出病史和用药,医生只改一个剂量,这比整段重写节省更多工作。ER若按字段统计能呈现差别;若只按整份文档“接受/拒绝”,则会把一次微小修改和彻底重写混为一谈。因此指标价值依赖工作单元定义,跨产品比较前必须先确认分母相同。
ER的评测思路可以应用到医疗以外的哪些行业?
法律合同可统计被律师保留的条款,客服可统计无需人工改写的回复,代码助手可统计最终合入且通过测试的补丁。关键是用责任人最终交付的工件做反馈,而不是用“生成完成”充当价值。
使用ER指标时,有哪些具体的行动建议来避免安全风险?
建议包括:先定义工作单元与风险等级,高风险项单独计算;同时报ER、人工复核分钟数、严重错误率、覆盖率与返工率;对未使用AI的同期样本做基线;随机抽查“直接接受”的记录,检查沉默错误和自动化偏见;按专科、病例复杂度和医生经验分层;保留模型版本、修改轨迹和签署人。在医疗等高风险场景,不适合把ER用于自动放宽人工复核,更不能把签署行为当成患者结局的替代指标。