内容提要
蚂蚁灵波开源轻量版世界模型 LingBot-World 2.0,参数仅 1.3B,可在消费级单卡 GPU 上本地实时生成世界。团队先训练因果世界模型底座,再通过一致性蒸馏与分布匹配蒸馏压缩计算,并让模型适应自身长时生成状态,从而降低使用门槛。
延伸解读
从14B到1.3B:不是简单裁剪,而是训练路线的自然产物
文章强调,轻量版并非先做大模型再压缩,而是先走通一条训练路线,小模型是这条路线走到最后自然出现的产物。团队先训练Causal World底座,再通过一致性蒸馏与分布匹配蒸馏压缩计算,并让模型适应自身长时生成状态。这种思路意味着小模型继承了完整研发链路,而非牺牲质量换尺寸。
长时生成的两大挑战:误差累积与过拟合
自回归世界模型在长时生成中,前面微小偏差会被后续输入放大,导致纹理模糊、几何变形甚至场景漂移。同时,纯Teacher Forcing在长上下文下容易过拟合干净Context,造成画质下降。LingBot-World 2.0通过MoBA在训练中引入双向Attention作为正则,缓解过拟合,并让模型适应更灵活的视频长度。
蒸馏策略:让Student提前见过自己会跑进的状态
高质量Backbone虽好但太慢,每帧需多步去噪。团队先用一致性蒸馏将去噪轨迹压缩到少数几步,再加入DMD并让Student在自己的长时self-rollout轨迹上训练。这样模型在训练时就提前见过部署后可能遇到的状态,从而减少长时自回归中的累计漂移,这是实现单卡实时生成的关键一步。
开源上游模型:降低门槛,也开放研发链路
此次不仅开源1.3B轻量版,还放出了Causal Pretrain和双向Teacher。小模型让更多人能把世界模型跑起来,而上游模型则让社区能在此基础上做后训练、蒸馏、压缩和垂直场景适配。文章认为,世界模型下半场比拼的可能是能否让普通显卡也跑得动,而开源上游正是降低门槛、促进扩散的重要方式。
Q&A
LingBot-World 2.0轻量版有多少参数?能在什么硬件上运行?
LingBot-World 2.0轻量版参数规模为1.3B,是面向消费级单卡GPU设计、可以在本地实现实时世界生成的模型。
世界模型和普通视频生成有什么区别?
普通视频生成是输入Prompt后等模型把整段视频生成完再交付结果;而世界模型是在生成一个持续演进的世界,人在场景里移动或转动视角,模型就得接着生成相应的画面变化。
LingBot-World 2.0轻量版是如何从14B压缩到1.3B的?
并非先做大模型再砍小,而是先训练因果世界模型底座(Causal World),再通过一致性蒸馏(Consistency Distillation)和分布匹配蒸馏(DMD)压缩计算,并让模型适应自身长时生成状态,小模型是这条训练路线走到最后自然出现的产物。
什么是MoBA?它在LingBot-World 2.0中起什么作用?
MoBA是Mixture of Bidirectional and Autoregressive Attention Mask。它在原有Teacher Forcing Mask里加入一部分双向Attention,相当于增加一层正则,让模型适应更灵活的视频长度,同时缓解长上下文中的过拟合和画质退化问题。
LingBot-World 2.0轻量版能实现哪些实时交互效果?
可以实时生成第一人称射击场景(角色移动、转动视角、开火,并看到爆炸、火焰、能量护盾等反馈),也能生成第三人称探索场景(如《奥德赛》风格,角色在巨型木马、城墙和火光间移动,空间关系维持稳定),还能生成不同风格的世界。
蚂蚁灵波开源LingBot-World 2.0轻量版的目的是什么?
目的是降低世界模型的使用门槛,让更多人能在消费级单卡GPU上把世界模型跑起来。同时开源Causal Pretrain和双向Teacher等上游模型,让社区能接着做后训练、蒸馏、压缩和垂直场景适配。