美国新AI模型专为定制而生

美国新AI模型专为定制而生

💡 原文英文,约4100词,阅读约需15分钟。
📝

内容提要

Thinking Machines发布开源模型Inkling,采用混合专家架构,总参数9750亿,但每次推理仅激活约410亿参数。该模型结合滑动窗口与全局注意力层,支持百万级token上下文,并使用相对位置编码以避免外推问题。Inkling支持图像和音频输入,并引入可调推理努力参数,旨在便于用户定制和微调。

🔎

延伸解读

稀疏激活的代价与收益

Inkling总参数9750亿,但每次推理仅激活约410亿参数,这大幅降低了单次推理的计算成本。然而,模型权重仍需全部加载到内存中,全精度检查点至少需要2TB显存(约8张B300或16张H200),量化后仍需约600GB(4张B300)。这意味着虽然单次推理便宜,但硬件门槛依然很高,适合有充足GPU资源的企业或研究机构。

长上下文的设计权衡

Inkling通过混合滑动窗口和全局注意力层实现百万级token上下文,其中55层为滑动窗口,11层为全局注意力。这种设计使长距离信息依赖少数全局层传递,但可能导致模型对长文档中细节的捕捉能力下降。用户在处理超长文本时,应意识到模型可能遗漏中间位置的特定信息,需结合其他工具或方法进行补充。

可调推理努力参数的实际影响

Inkling引入0到1之间的推理努力参数,通过系统消息控制模型推理深度,该参数在强化学习阶段训练得到。高努力值鼓励更长的推理过程,但不保证答案质量;低努力值则偏向简洁回答。用户需注意,高努力设置可能产生更多token,需相应调整最大token限制,避免输出被截断。

开源许可与定制潜力

Inkling以Apache 2.0许可开源,允许自由下载、微调和商用,这为定制化提供了便利。但训练数据、训练代码和具体配方未公开,模型卡仅提供一般性描述,因此无法完全复现或审计。此外,模型卡建议在面向消费者的部署中叠加外部审核工具,因为模型自身的安全行为可能因微调而改变。

Q&A

Inkling模型的总参数量和激活参数量分别是多少?

Inkling模型的总参数量为9750亿,但每次推理仅激活约410亿参数。

Inkling模型如何实现百万级token的上下文窗口?

Inkling通过混合使用滑动窗口注意力层和全局注意力层来实现百万级token的上下文窗口。具体来说,66层中有55层是滑动窗口层,11层是全局注意力层,比例为5:1。滑动窗口层只关注最近的固定数量的token,而全局注意力层可以关注整个序列,从而在控制计算成本的同时实现长上下文支持。

Inkling模型为什么选择相对位置编码而不是RoPE?

Inkling选择相对位置编码是因为它避免了RoPE在长序列上的外推问题。相对位置编码学习的是两个token之间的距离对应的值,而不是绝对位置,因此对于训练中未见过的长距离,它可以使用训练中见过的距离值,无需外推。Thinking Machines表示,在他们的测试中,相对位置编码在长序列上的表现和泛化能力优于RoPE。

Inkling模型如何处理图像和音频输入?

Inkling模型采用无编码器架构处理图像和音频。音频先转换为mel频谱图,然后通过dMel方法量化;图像则被切割成40x40像素的补丁,通过hMLP stem处理。这些处理后的特征经过轻量级转换层后,与文本token一起输入模型。所有组件都从头开始联合训练,无需单独的预训练编码器。

Inkling模型的推理努力参数是什么?如何调节?

推理努力参数是一个介于0和1之间的数值,用于控制模型在回答前进行推理的程度。预设值包括0(无)、0.1(最小)、0.2(低)、0.7(中)、0.9(默认)和0.99(最高)。该参数通过系统消息注入,并在强化学习训练中学习到不同努力级别对应的推理长度。较高的努力级别鼓励更长的推理,但并非保证;努力级别与最大token限制是独立的设置。

Inkling模型的开源许可和硬件要求是什么?

Inkling模型的权重以Apache 2.0许可证发布在Hugging Face上,允许自由下载和微调。硬件方面,全精度检查点需要至少2TB的GPU内存,相当于8张NVIDIA B300或16张H200;量化检查点约需600GB,可运行在4张B300上。

Inkling模型如何避免专家路由崩溃?

Inkling采用了一种无辅助损失的负载均衡方法,通过为每个专家维护一个独立的偏置值,该偏置在专家选择时使用,但在加权输出时不使用。偏置根据专家使用频率动态调整,以平衡专家负载,同时不干扰主训练目标。这种方法避免了传统辅助损失带来的梯度冲突。

Inkling模型与NVIDIA Nemotron 3 Ultra在编码基准上的对比如何?

在编码基准Terminal Bench 2.1上,Inkling模型达到了与NVIDIA Nemotron 3 Ultra相同的分数,但生成的token数量约为其三分之一。这表明Inkling在效率上具有优势。

🏷️

标签

➡️

继续阅读