【Transformer 与注意力机制】34|Scaling Laws:Kaplan 与 Chinchilla 之争,以及算力预算怎么分配

💡 原文中文,约16000字,阅读约需38分钟。
📝

内容提要

本文探讨大模型训练中算力分配的核心问题:模型参数与训练数据应如何配比。Kaplan 研究建议偏重模型规模,而 Chinchilla 研究通过三种方法证明两者应等比例增长,并指出前者因学习率调度设计缺陷导致结论偏差。文章还讨论了推理成本、数据受限等现实约束对最优配比的影响,以及相关复现争议。

🔎

延伸解读

为什么Kaplan的结论会偏?

Kaplan和Chinchilla的结论差异并非源于新规律,而是实验设计缺陷。Kaplan对所有模型使用固定长度的学习率余弦调度,导致少token配置的loss被系统性高估,从而偏向“大模型少数据”。Chinchilla通过匹配调度长度修正了这一点,得到等比例增长的结论。这提醒我们,scaling law的拟合对训练细节高度敏感,复现时需谨慎。

compute-optimal不等于部署最优

Chinchilla优化的是训练loss,未考虑推理成本。Sardana等(ICML 2024)将推理成本纳入后,高推理需求下应训练更小但tokens/parameter更高的模型,如Llama 2 7B约286。这解释了为何Llama 2等模型未严格遵循20 tokens/parameter——它们优化的是全生命周期成本,而非单纯训练loss。

复现争议反而加固了经验法则

Epoch AI的复现研究发现Chinchilla方法三的置信区间窄到不合理,且内部方法矛盾,但重新拟合后三种方法一致,最优比例约25.6 tokens/parameter,支持20左右的经验法则。争议暴露了拟合过程可能存在的bug,但核心结论“模型和数据应大致同比例增长”并未被推翻,反而更稳固。

Q&A

Kaplan 和 Chinchilla 在模型参数与训练数据配比上的核心结论有何不同?

Kaplan et al. (2020) 提出 compute-optimal 配比建议模型大小以 C^0.73 增长、数据以 C^0.27 增长,偏向大模型少数据;Chinchilla (2022) 用三种独立方法证明模型和数据应等比例增长(约 C^0.5 对 C^0.5),即模型参数和训练数据应大致同比例增长。

为什么 Chinchilla 论文认为 Kaplan 的结论有偏差?具体原因是什么?

Chinchilla 论文指出 Kaplan 实验设计中的一个缺陷:Kaplan 对所有模型大小使用同一个固定长度的学习率余弦调度,导致训练 token 数较少的配置在截取中间 loss 时被系统性高估,因为学习率尚未衰减到位。这使拟合算法误以为减少训练数据、增大模型更划算,从而将数据指数 b 拟合得偏小,导致结论偏向大模型少数据。

Chinchilla 论文用哪三种方法证明模型和数据应等比例增长?

Chinchilla 论文使用三种独立方法:方法一固定模型大小扫描训练步数,从训练曲线包络拟合出 N_opt ∝ C^0.50, D_opt ∝ C^0.50;方法二固定 9 个 FLOPs 预算扫描模型大小,得到 IsoFLOP 曲线,拟合出 a≈0.49, b≈0.51;方法三直接对 (N,D) 空间拟合联合解析式 L(N,D)=E+A/N^α+B/D^β,在 FLOPs 约束下最小化得到 a≈0.46, b≈0.54。三种方法均指向约 0.5 的指数。

什么是 compute-optimal?它优化的是什么目标?

compute-optimal 指的是在固定训练 FLOPs 预算下,如何分配模型参数 N 和训练 token 数 D 使得最终训练 loss 最低。它优化的是训练 loss,不包含推理成本、部署硬件或下游任务表现。

为什么 Llama 2 的 7B 和 13B 模型 tokens/parameter 比例远高于 20?这是否违反 scaling law?

Llama 2 的 7B 和 13B 模型共享 2 万亿 token 语料,导致 tokens/parameter 比例分别约为 286 和 154,远高于 Chinchilla 建议的 20。这是因为这两个尺寸是为大规模推理部署设计的,需要更小的模型以降低推理成本,因此训练时故意多喂 token,用训练算力换取推理效率。这并不违反 scaling law,而是优化目标从训练 loss 最小化转向全生命周期成本最小化,属于理性选择。

Epoch AI 的复现研究对 Chinchilla 论文的结论有何影响?

Epoch AI 的复现研究(arXiv:2404.10102)发现 Chinchilla 论文方法三的置信区间窄到不合理,且内部三种方法互相矛盾。重新拟合后,三种方法重新一致,最优比例约为 25.6 tokens/parameter,落在 20 tokens/parameter 经验法则的合理范围内。因此,复现研究并未推翻 Chinchilla 的核心结论,反而使其更站得住脚,但暴露了原论文拟合过程中的方法论问题。

在数据受限的情况下,Chinchilla 三角假设有什么问题?

Chinchilla 三角假设 D(训练 token 数)可以自由增长,但在现实中高质量文本数据有限。Muennighoff et al. (NeurIPS 2023) 发现重复数据在大约 4 个 epoch 内价值与全新数据几乎相同,但超过后边际价值迅速衰减。因此,当 D 不能随算力自由增长时,需要加入数据上限约束,Chinchilla 公式本身不包含这一约束。

推理成本如何影响最优的模型大小和训练数据配比?

Sardana et al. (ICML 2024) 将推理成本纳入 Chinchilla 框架,发现如果预期推理需求足够大(如十亿次请求),训练一个比 Chinchilla-optimal 更小但训练 token 数更多的模型,全生命周期总成本更低,因为推理成本随请求量线性累积,更小的模型每次推理更便宜。因此,高推理需求下应选择更小模型和更高的 tokens/parameter 比例。

🏷️

标签

➡️

继续阅读