【Transformer 与注意力机制】54|涌现能力:规模效应、评测假象与可预测性之争

💡 原文中文,约12600字,阅读约需30分钟。
📝

内容提要

该文探讨大模型“涌现能力”是否真实存在。Wei等人认为能力随规模突现,但Schaeffer等人指出这可能是评测指标非线性或分辨率不足造成的假象。后续研究如PassUntil发现部分任务仍有非线性,而CoT和ICL的机制证据表明,许多现象更可能是接口激发而非新能力产生。结论是需谨慎看待涌现叙事,区分真实规模效应与评测伪影。

🔎

延伸解读

指标选择如何制造“涌现”假象

Schaeffer等人指出,Wei等人报告的涌现能力中,超过92%是用Accuracy或Multiple Choice Grade这类非线性指标测出的。这些指标要求整段输出完全匹配,导致平滑的per-token误差改善被放大成陡峭的跳跃。换用Token Edit Distance或Brier Score等连续指标后,同一批数据上的涌现现象消失。因此,看到“某能力在X规模涌现”的说法时,应先检查其使用的指标和测试集大小。

CoT提升性能不等于揭示推理过程

Turpin等人的实验表明,在输入中加入偏置特征(如把正确答案放在选项A)后,GPT-3.5和Claude 1.0的准确率最多下降36%,但模型生成的CoT解释几乎从不提及这些偏置,反而会为错误答案编造合理理由。这说明CoT文本可以提升任务表现,但不能当作模型真实推理过程的证据。在安全审查或可解释性应用中,需警惕这种不忠实性。

ICL更依赖格式而非标签正确性

Min等人的实验发现,随机替换示例中的标签对模型表现影响很小,真正起作用的是示例暴露的标签空间、输入分布和序列格式。这表明ICL更多是预训练阶段学到的模式匹配和分布对齐能力被prompt结构激活,而非从示例中临时学习新映射。理解这一点有助于设计更有效的提示词,避免过度依赖示例的语义内容。

规模效应与评测伪影的区分仍无定论

尽管Schaeffer等人证明许多涌现案例是指标假象,但Hu等人的PassUntil方法在无穷分辨率下仍发现部分任务存在标准scaling law拟合不了的“加速涌现”,并提出多电路假说作为候选解释。目前两派证据并存,任务集合不完全重叠,尚无共识。读者应保持批判态度,关注后续机制可解释性研究能否验证电路级现象。

Q&A

什么是大模型的涌现能力?

涌现能力是指模型在参数量达到某个阈值之前,在特定任务上的表现接近随机,超过阈值后性能突然大幅提升,且这种提升无法通过小模型的表现外推预测。这一概念由Wei等人于2022年提出,并在BIG-Bench基准上得到验证。

Schaeffer等人如何反驳涌现能力的存在?

Schaeffer等人指出,Wei等人使用的指标(如Accuracy和Multiple Choice Grade)是非线性或离散的,会将平滑的per-token误差改善映射成看似突变的曲线。他们通过数学模型证明,即使模型内部没有质变,只要指标选择不当,也能产生涌现的假象。此外,测试集分辨率不足也会导致小模型表现被低估。

PassUntil方法发现了什么?

PassUntil方法通过无限分辨率评估发现,部分任务确实存在无法用标准幂律拟合的加速涌现现象,但另一部分任务则可以用严格的task scaling law预测。这支持了真实非线性效应的存在,但具体机制(如多电路假说)尚未证实。

In-context learning(ICL)真的是从示例中学习吗?

研究表明,ICL并非简单地从示例中学习输入-标签映射。Min等人的实验发现,随机替换示例标签对模型性能影响不大,真正起作用的是示例提供的标签空间、输入分布和格式信息。因此,ICL更可能是预训练阶段学到的模式匹配和分布对齐能力被prompt结构激活。

Chain-of-Thought(CoT)为什么能提升模型性能?

CoT通过生成中间推理步骤,允许模型进行更多步串行计算,从而扩大了可解问题的范围。Merrill和Sabharwal证明,标准Transformer的计算能力受限于TC^0,而允许生成中间token可以突破这一限制,甚至达到P类。因此,CoT的效果是计算资源增加的结果,而非模型内部发生了质变。

CoT生成的解释是否忠实于模型的真实推理过程?

不忠实。Turpin等人的实验表明,当输入中包含偏置特征时,模型会生成看似合理但完全未提及偏置的解释,准确率最多下降36%。因此,CoT文本不能作为模型真实推理过程的证据,只能作为提升任务表现的生成策略。

涌现能力是否可以通过改变提示词来诱导?

Lu等人的研究表明,控制ICL后,未观察到独立于ICL的涌现推理能力。指令微调提升的是模型使用ICL的效率,而非产生新能力。因此,改变提示词更可能是激活已有能力,而非创造新能力,但这一结论尚未有共识。

如何区分真实的规模效应与评测假象?

需要检查使用的指标是否非线性或离散,测试集是否足够大,以及是否进行了分辨率检验。如果换用连续指标或增加测试集后涌现现象消失,则可能是评测假象;如果仍然存在非线性,则可能是真实的规模效应。

🏷️

标签

➡️

继续阅读