让AI审科学公式,它最适合当比较员而非裁判

让AI审科学公式,它最适合当比较员而非裁判

💡 原文中文,约1800字,阅读约需5分钟。
📝

内容提要

研究显示,大模型审科学公式时,让模型比较多个候选公式比单独解释更可靠,但输出仍存在生理和数学疑点。样本小,仅属案例研究。建议AI仅用于候选筛查与风险提示,硬规则先检查单位、范围等,专家复核签字,不能作为独立验证者或用于临床诊断。

🔎

延伸解读

比较任务为何更可靠

文章指出,让模型解释单个项为何影响体脂,容易为相关性编造因果故事;而比较多个候选公式时,任务可锚定在变量合理性、单位一致性、复杂度和极端输入表现等可见特征上。前者要求生成正确科学机制,后者更像按规则做候选筛查,因此临床评价更积极。这提示读者,使用大模型时应优先设计比较型任务,而非开放式解释。

证据分层与分歧保留

文章强调审计记录应分层保存:底层是原始数据、变量定义和公式,第二层是可重复的程序检查,第三层是模型输出,最上层是专家结论与签名。上层可引用下层,但不能用“专家觉得模型说得像”替代数据证据。当多次运行意见不一致时,不应多数表决删除分歧,因为分歧本身可能是提示含糊、公式接近边界或模型补故事的风险信号。

适用边界与风险提示

该方法适合研究早期的候选筛查、解释初稿与风险清单,但不适合临床诊断、治疗建议、监管证明或缺少专家复核的自动决策。论文样本很小,仅四个表达式、三名临床医生和有限重复,属案例研究,不足以证明大模型普遍具备医学审计能力。若结果影响真实患者,部署前还需外部数据验证、亚组分析和漂移监测,语言模型审计记录只能作为证据链的一段。

Q&A

大模型在审查科学公式时,为什么比较多个候选公式比单独解释更可靠?

因为比较任务可以锚定在可见特征上,如变量是否合理、单位是否一致、复杂度谁更高、极端输入下谁更失真,而单独解释要求模型生成正确的科学机制,容易为相关性编造因果故事。

这项关于AI审公式的研究存在哪些局限性?

样本很小,只有四个表达式、三名临床医生和有限重复,属于案例研究,不足以证明大模型普遍具备医学审计能力,更不能推出诊断安全性。

在科研和医疗中,使用大模型审计公式的正确流程是什么?

先用确定性程序检查单位、范围、单调性和异常值,再调用大模型;一次给出多个候选,要求按固定准则比较;同一任务至少重复三次,标红不一致处;要求每条解释对应数据证据或文献;最终结论由具名领域专家签署,并保留被否决的模型建议。

大模型适合在哪些场景下用于公式审计?不适合哪些场景?

适合研究早期的候选筛查、解释初稿与风险清单;不适合临床诊断、治疗建议、监管证明或缺少专家复核的自动决策。

当多个模型或多次运行结果不一致时,应该如何处理?

不要多数表决后删掉分歧,分歧本身就是风险信号,可能是提示含糊、公式接近边界或模型在补故事。应把不一致处标红给专家,最有价值的输出是提示具体疑点,如“B在年龄变量上的解释三次不一致,请检查量纲与样本分布”。

AI审计公式时,证据应该如何分层保存?

最底层是原始数据、变量定义和公式;第二层是可重复的程序检查;第三层是模型输出;最上层是专家结论与签名。上层可以引用下层,但不能用“专家觉得模型说得像”替代数据证据。

🏷️

标签

➡️

继续阅读