内容提要
研究显示,大模型审科学公式时,让模型比较多个候选公式比单独解释更可靠,但输出仍存在生理和数学疑点。样本小,仅属案例研究。建议AI仅用于候选筛查与风险提示,硬规则先检查单位、范围等,专家复核签字,不能作为独立验证者或用于临床诊断。
延伸解读
比较任务为何更可靠
文章指出,让模型解释单个项为何影响体脂,容易为相关性编造因果故事;而比较多个候选公式时,任务可锚定在变量合理性、单位一致性、复杂度和极端输入表现等可见特征上。前者要求生成正确科学机制,后者更像按规则做候选筛查,因此临床评价更积极。这提示读者,使用大模型时应优先设计比较型任务,而非开放式解释。
证据分层与分歧保留
文章强调审计记录应分层保存:底层是原始数据、变量定义和公式,第二层是可重复的程序检查,第三层是模型输出,最上层是专家结论与签名。上层可引用下层,但不能用“专家觉得模型说得像”替代数据证据。当多次运行意见不一致时,不应多数表决删除分歧,因为分歧本身可能是提示含糊、公式接近边界或模型补故事的风险信号。
适用边界与风险提示
该方法适合研究早期的候选筛查、解释初稿与风险清单,但不适合临床诊断、治疗建议、监管证明或缺少专家复核的自动决策。论文样本很小,仅四个表达式、三名临床医生和有限重复,属案例研究,不足以证明大模型普遍具备医学审计能力。若结果影响真实患者,部署前还需外部数据验证、亚组分析和漂移监测,语言模型审计记录只能作为证据链的一段。
Q&A
大模型在审查科学公式时,为什么比较多个候选公式比单独解释更可靠?
因为比较任务可以锚定在可见特征上,如变量是否合理、单位是否一致、复杂度谁更高、极端输入下谁更失真,而单独解释要求模型生成正确的科学机制,容易为相关性编造因果故事。
这项关于AI审公式的研究存在哪些局限性?
样本很小,只有四个表达式、三名临床医生和有限重复,属于案例研究,不足以证明大模型普遍具备医学审计能力,更不能推出诊断安全性。
在科研和医疗中,使用大模型审计公式的正确流程是什么?
先用确定性程序检查单位、范围、单调性和异常值,再调用大模型;一次给出多个候选,要求按固定准则比较;同一任务至少重复三次,标红不一致处;要求每条解释对应数据证据或文献;最终结论由具名领域专家签署,并保留被否决的模型建议。
大模型适合在哪些场景下用于公式审计?不适合哪些场景?
适合研究早期的候选筛查、解释初稿与风险清单;不适合临床诊断、治疗建议、监管证明或缺少专家复核的自动决策。
当多个模型或多次运行结果不一致时,应该如何处理?
不要多数表决后删掉分歧,分歧本身就是风险信号,可能是提示含糊、公式接近边界或模型在补故事。应把不一致处标红给专家,最有价值的输出是提示具体疑点,如“B在年龄变量上的解释三次不一致,请检查量纲与样本分布”。
AI审计公式时,证据应该如何分层保存?
最底层是原始数据、变量定义和公式;第二层是可重复的程序检查;第三层是模型输出;最上层是专家结论与签名。上层可以引用下层,但不能用“专家觉得模型说得像”替代数据证据。