内容提要
蚂蚁集团inclusionAI团队发布千亿参数MoE扩散模型LLaDA2.2,首次将扩散模型应用于长程Agent任务。该模型支持128K上下文,通过Levenshtein编辑、强化学习L-EBPO和BlockRouting机制,实现自我修正、环境反馈处理及高效推理。在七大基准上接近顶尖自回归模型,吞吐量达1.64倍,预示扩散与自回归模型将双轨并行。
延伸解读
扩散模型为何长期缺席Agent赛道
传统扩散模型在并行生成时缺乏严格的序列因果约束,Token间关联弱,在普通文本生成中影响不大,但在Agent场景中,输出会被真实执行,微小错误可能被后续交互放大,导致目标漂移。因此,扩散模型此前难以胜任长程Agent任务,而LLaDA2.2通过Levenshtein编辑和强化学习解决了这一痛点。
Levenshtein编辑如何实现边行动边纠错
LLaDA2.2在块内支持KEEP、SUBSTITUTE、DELETE、INSERT四种原子操作,通过LCS对齐动态生成编辑标签,使模型能对生成结果进行增删改。在SWE-bench Verified上,仅开启该机制就带来8.6个百分点的绝对提升,验证了其在Agent任务中的有效性。
效率与能力的平衡:扩散模型的工程价值
LLaDA2.2通过BlockRouting机制将每块激活专家数恒定,降低HBM流量和通信开销,在11类工作负载上平均吞吐量达到自回归模型的1.64倍,FP8量化后还可额外提升18.6%。这表明扩散模型在保持接近自回归模型能力的同时,具备更优的速度和成本优势,适合对延迟和成本敏感的Agent部署场景。
双轨并行:未来Agent架构的可能方向
LLaDA2.2并未终结自回归模型的统治,在严格结构化输出和复杂代码生成上自回归仍更成熟。但文章指出,后Agent时代可能同时需要两种机制:自回归负责强因果流程,扩散负责快速并行生成,根据任务阶段动态切换。这种融合思路为Agent架构设计提供了新视角。
Q&A
LLaDA2.2是什么?它有什么特点?
LLaDA2.2是蚂蚁集团inclusionAI团队发布的全球首个大规模Agentic扩散模型,是一个千亿参数的MoE扩散语言模型,原生支持128K上下文。它首次将Levenshtein编辑、面向环境反馈的强化学习(L-EBPO)和长上下文工程架构(BlockRouting)整合进扩散模型Agent系统,能并行生成、自我修正,并在七大Agent基准上接近顶尖自回归模型,吞吐量达1.64倍。
LLaDA2.2在技术上有哪些创新?
LLaDA2.2有三项关键创新:1)采用Levenshtein编辑范式,在块内支持KEEP、SUBSTITUTE、DELETE、INSERT四种原子操作,使模型能自我修正生成结果;2)提出L-EBPO(Levenshtein Editing Evidence Lower Bound Policy Optimization),将多轮交互中的编辑决策建模为强化学习问题,让模型根据环境反馈自主修正;3)通过渐进式长上下文训练将上下文窗口扩展到128K,并采用BlockRouting机制降低推理成本。
扩散模型在Agent任务中面临哪些挑战?LLaDA2.2如何解决?
扩散模型在Agent任务中面临两大挑战:一是结构刚性问题,传统块并行解码生成后无法修改,导致错误累积;二是缺乏环境反馈处理能力,早期偏差会被放大。LLaDA2.2通过Levenshtein编辑实现块内动态增删改,通过L-EBPO强化学习让模型根据环境反馈自主决策编辑操作,从而解决这些问题。
LLaDA2.2的性能表现如何?与自回归模型相比有何优势?
在七大Agent基准上,LLaDA2.2-flash平均分53.83,顶尖自回归模型Ling-2.6-flash为55.74,差距在2分以内,且在τ²-Bench、PinchBench、MCP-Atlas三项交互式任务上实现反超。效率方面,BF16平均吞吐量是Ling-2.6-flash的1.64倍,FP8量化后额外提升18.6%。优势在于能力接近自回归模型,但速度更快、成本更低。
LLaDA2.2的BlockRouting机制是什么?有什么作用?
BlockRouting是LLaDA2.2为降低推理成本提出的机制。标准MoE为Token级路由,每个Token独立选择专家,导致激活专家集合大、HBM流量和通信开销高。BlockRouting先在block层面筛选top-C个专家形成固定专家池,再在内部执行Token级top-k路由,屏蔽池外专家,从而限制每块激活专家数量,降低HBM流量和通信成本。
LLaDA2.2对Agent模型的发展有何意义?
LLaDA2.2证明了扩散模型也能胜任长程Agent任务,打破了自回归模型的垄断。它表明纯自回归模型不是绝对选项,扩散模型在速度、成本上有优势,适合快速探索和并行生成。未来Agent系统可能采用双轨并行,自回归模型负责严格结构化输出和强因果流程,扩散模型负责快速响应,两者融合、动态切换。
LLaDA2.2在哪些基准上超越了自回归模型?
LLaDA2.2在τ²-Bench、PinchBench、MCP-Atlas三项交互式任务上超越了顶尖自回归模型Ling-2.6-flash,这些任务偏向真实交互场景。
LLaDA2.2的上下文窗口有多大?如何实现的?
LLaDA2.2原生支持128K上下文窗口,通过渐进式长上下文训练实现,从8K逐步扩展到64K再到128K。