内容提要
Mostik团队开发了一种“桥”技术,使大模型(如753B的GLM-5.2)能直接向小模型(如4B的Qwen-3.5)传递隐藏状态,无需文本输出,从而将小模型性能提升50%,准确率提高25%,推理成本降至二十分之一。该技术基于模型内部状态包含深层计算信息,团队由菲尔兹奖得主领导,正探索蒸馏和专项化应用。
延伸解读
“桥”技术的核心:利用隐藏状态而非文本
Mostik团队指出,大模型生成文本时,内部会构建超过一百个隐藏向量,包含约两兆字节的状态信息,但最终只输出一个token(约17比特),其余信息被丢弃。传统模型协作依赖文本输出,效率极低。他们的“桥”技术让大模型直接传递隐藏状态给小模型,无需文本,从而大幅提升信息传递效率。这一发现基于可解释性研究,表明内部状态包含深层计算信息,如提前规划的词表征。
成本优势:预填充与解码的巧妙分工
桥方案的关键在于成本设计:大模型只做预填充(一次性读取输入),不做解码(逐token生成),而解码是最昂贵的环节。小模型负责所有文本生成,因此大模型的推理成本降至约二十分之一。实验显示,4B小模型在桥的加持下,弥补了与753B大模型50%的性能差距,准确率提升25%,在更难子集上提升达2倍。相比传统文本接力,桥方案在性能-算力权衡上更优,尤其在交接点极早时优势明显。
跨模型通用性与未来方向
实验中,GLM-5.2和Qwen-3.5由不同团队训练,但内部表征能通过桥有效传递,且双方权重完全冻结,说明桥利用的结构是模型训练中自然产生的。团队正探索两条路径:蒸馏(将教师内部状态同步给学生)和专项化(小模型带桥训练专业能力,保留通用能力)。此外,桥可能提供新的安全观察面,但仍在早期阶段,需进一步验证其跨任务和真实负载的可靠性。
Q&A
Mostik团队提出的“桥”技术是什么?
Mostik团队开发了一种“桥”技术,让大模型(如753B的GLM-5.2)通过一个小型训练过的桥,将隐藏状态直接传递给小模型(如4B的Qwen-3.5),无需文本输出,小模型直接使用这些内部状态生成最终答案。
桥技术如何降低推理成本?
桥技术让大模型只做预填充(一次性读取输入),不做解码(逐个生成token),解码任务交给小模型,从而将大模型的推理成本降至原来的约二十分之一。
桥技术相比传统文本接力有什么优势?
桥技术直接传递隐藏状态,避免了文本压缩丢失信息,在交接点极早时优势明显,因为此时大模型尚未生成文字,但隐藏状态已包含处理信息。在所有测试的大模型算力水平上,桥方案性能-算力权衡都更优。
为什么模型间的文本交流效率低下?
模型生成一个token时,内部会构建超过一百个隐藏向量,包含约两兆字节信息,但最终只输出一个token(约17比特),其余信息被丢弃。文本交流只基于这17比特,丢失了深层计算过程。
Mostik团队在ARC-AGI 3上取得了什么成绩?
Mostik团队用4B Qwen-3.5和753B GLM-5.2的组合在ARC-AGI 3上取得了高分,4B小模型在桥的加持下弥补了与753B大模型之间50%的性能差距,准确率提升25%,在难题子集上提升达2倍。
Mostik团队计划如何进一步发展桥技术?
Mostik团队正探索两条路径:一是蒸馏,将教师模型的内部状态同步给学生模型,提高训练效率;二是专项化,让小模型带桥训练专业领域能力,同时保留通用能力。此外,还考虑利用桥增加安全监控的观察面。
桥技术为什么能跨模型工作而不需要微调?
实验中两个模型(GLM-5.2和Qwen-3.5)完全冻结,桥是唯一训练部分。结果表明,不同团队、不同数据训练的模型内部表征能通过桥有效传递,说明桥利用的结构是模型训练中自然产生的,因此无需微调。
Mostik团队由哪些关键人物组成?
Mostik团队成立仅4个月,共15人,其中12名博士。首席科学家是菲尔兹奖得主Stanislav Smirnov,CEO是Sasha Malysheva,她是核心方法的开发者之一。