信任,但要验证:用原子声明核查对抗大模型幻觉

信任,但要验证:用原子声明核查对抗大模型幻觉

💡 原文英文,约3600词,阅读约需13分钟。
📝

内容提要

文章介绍用“原子声明核查”防止大模型幻觉,核心是生成与验证分离:第一遍合并重复知识库文章,代码、命令、版本号等原样保留;第二遍将原文拆成最小可核查声明,逐条比对合并稿,标记存在、部分或缺失,并记录冲突。人工只需裁决少量异常项,约五分钟完成一次合并,避免遗漏被误写入知识库。

🔎

延伸解读

生成与验证分离:架构上的信任

文章的核心设计是将生成与验证拆分为两个独立步骤。第一遍合并时,模型专注于产出流畅的合并稿,但可能为了可读性牺牲准确性;第二遍验证则用全新上下文,将原文拆解为原子声明,逐条核对合并稿。这种分离避免了模型“自证清白”的偏差,因为验证任务不要求创造性,只做机械的匹配检查,模型表现更可靠。

原子声明:让遗漏无处可藏

将文章拆解为最小可核查的声明(如“此设置需重启后生效”),使模糊的整体质量判断转化为明确的“存在/部分/缺失”状态。这不仅能发现幻觉,更能捕捉最危险的失败模式——静默遗漏。因为遗漏的句子在合并稿中不存在,人类审阅时极易忽略,而原子清单强制每条声明都必须被显式处理,否则无法通过。

人工角色转变:从重读到裁决

传统审阅需要通读两篇原文并凭记忆判断合并稿是否完整,耗时且易漏。新流程中,人工只需处理覆盖表中标记为“缺失”或“部分”的少量异常项,以及冲突日志中的矛盾点。文章示例中,一次合并仅需约五分钟裁决,因为大部分声明状态为“存在”,无需干预。这让人工精力集中在真正需要判断力的地方。

可迁移的设计原则

该模式不限于知识库合并。任何高风险LLM应用都可借鉴:不让生成环节自我认证;将保真度问题分解为原子级检查;使遗漏可枚举;对命令、版本号等关键载荷原样保留;给人一份决策清单而非完整文档。这些原则将模型不可靠性从阻碍转化为可管理的成本,通过架构设计而非模型本身来建立信任。

❓

Q&A

原子声明核查方法是如何工作的?

该方法采用生成与验证分离的两遍流程。第一遍合并:将两篇重复文章合并为一篇,代码块、命令、配置片段、URL和版本号必须原样保留,散文可以重写。第二遍验证:将每篇源文章分解为最小可独立核查的原子声明,逐条与合并稿比对,标记为存在、部分或缺失,并单独记录源文章之间的冲突。最终输出覆盖表和冲突日志,人工只需裁决少量异常项。

为什么不能直接用大模型合并知识库文章?

直接让大模型合并文章会产生幻觉和静默遗漏。合并结果可能丢失前提步骤、版本约束漂移(如从8.12+变成8.x)、特定配置的注意事项消失,甚至出现从未存在的参数。在合并工作流中,这些错误会被写入知识库成为权威内容,而源文章被退役,错误将永久存在且无法对比。流畅性掩盖了问题,90%忠实和100%忠实的合并文章读起来一样,人工审阅时容易略过。

原子声明核查中,为什么要把文章拆解成原子声明?

因为“这个合并是否忠实”对AI来说是无法回答的整体性、主观性问题,而“合并后的文章是否仍说明此设置需要重启”是针对具体文本的是非题。拆解成原子声明将开放式生成判断转化为数百个狭窄的蕴含检查,这种任务形状模型可靠,不需要创造力。此外,原子分解能捕获流畅性掩盖的静默遗漏——幻觉的命令至少可见,而悄悄丢失的前提步骤按定义不可见,枚举所有源声明后,每个声明都必须被明确交代,沉默不再是可能的结果。

人工在原子声明核查流程中扮演什么角色?

人工不再被问“这个合并好不好”,而是拿到一份简短清单:哪些声明标记为缺失、哪些源文章冲突,然后做出裁决。这是一个五分钟、有明确完成定义的任务,而不是一小时、不知道何时结束的任务。工程师拿到合并文章和合并后的覆盖表后,手工做最终编辑。工具的目标不是移除人类,而是把“重读两篇文章并希望注意到丢失内容”替换为“这里有11行需要决策”。

覆盖表中的三种状态分别代表什么?

三种状态是:存在(present)、缺失(missing)和部分(partial)。存在通常不需要处理,占大多数行,任务量因此坍缩到异常项上。缺失通常是正确的,多数遗漏是有意的(冗余或未达质量标准),关键是决策现在可见并有签字确认。部分是最有趣的状态,典型情况是一个工程师写“影响8.x”,另一个写“影响8.12.0到8.12.3”,两者都正确但后者更有用,人工在此处每分钟价值最高,可调整粒度、恢复注意事项、收紧版本约束。

这个工具还有哪些重要的设计护栏?

工具有三个额外设计:一是在开始前检查两篇文章是否真的是重复,许多“重复”其实是相邻主题,合并会破坏信息,拒绝合并是重要功能;二是可调整的文案编辑强度,从轻触到完全重写,成熟文章和两段式短文需要不同处理,即使重度重写也保留原子声明;三是零基础设施,作为自包含的浏览器扩展发布,无需新服务、新记录系统,数据不离开原有路径,在工程师已使用的工具内工作。

原子声明核查方法可以推广到其他LLM应用场景吗?

可以。文章总结的可迁移原则包括:永远不要让生成过程自我认证,验证必须结构分离并有自己的输入和成功标准;将忠实度问题分解为原子,整体质量判断无法验证而原子声明可以;让遗漏可枚举,静默丢失比幻觉更危险,唯一防御是明确列出必须保留的内容;固定载荷,命令、版本、标识符和配置只复制不生成,模型只用于散文;给人类决策清单而非文档,审阅工作量应随标记问题数量而非输出长度扩展。

🏷️

标签

➡️

继续阅读