内容提要
本文介绍CalibAtt,一种无需训练的加速文本到视频生成方法。它通过离线校准识别注意力中的稀疏和重复模式,在推理时跳过不重要的token连接,实现硬件高效计算。实验表明,在Wan 2.1等模型上,CalibAtt可提升端到端速度达1.58倍,同时保持视频质量和文本对齐。
延伸解读
核心观察:注意力中的稀疏与重复模式
文章指出,在文本到视频生成的扩散模型中,注意力计算存在大量得分极低的token连接,且这些模式在不同输入间常重复出现。这意味着许多计算是冗余的,跳过它们对生成结果影响甚微。这一发现不仅适用于全局token,也适用于局部token块,为后续的加速方法提供了理论基础。
CalibAtt的加速机制
CalibAtt通过离线校准阶段识别出稳定的块级稀疏性和重复模式,并将其编译为针对每个层、头和扩散时间步的优化注意力操作。推理时,仅密集计算选中的输入相关连接,跳过未选中的部分,并以硬件高效方式实现。这种方法无需训练,直接应用于现有模型,如Wan 2.1 14B和Mochi 1,在多种分辨率下均有效。
性能与质量权衡
实验表明,CalibAtt在Wan 2.1等模型上可实现高达1.58倍的端到端加速,同时保持视频生成质量和文本-视频对齐。相比其他无需训练的方法,CalibAtt在加速效果上更优,且不牺牲生成质量。这为实际应用中部署高质量视频生成模型提供了更高效的解决方案。
Q&A
CalibAtt是什么?它如何加速文本到视频生成?
CalibAtt是一种无需训练的加速文本到视频生成的方法。它通过离线校准识别注意力中的稀疏和重复模式,在推理时跳过不重要的token连接,实现硬件高效计算,从而加速生成过程。
CalibAtt的核心观察是什么?
CalibAtt的核心观察是:在文本到视频生成模型的注意力机制中,很大一部分token之间的连接得分始终很低,且这些模式在不同输入间重复出现。因此,这些计算可以跳过而不影响结果。
CalibAtt是如何实现无需训练加速的?
CalibAtt通过离线校准阶段识别块级别的稀疏性和重复模式,这些模式在不同输入间稳定,然后为每一层、每个头和每个扩散时间步编译成优化的注意力操作。推理时,只计算选中的输入相关连接,跳过未选中的,从而实现硬件高效计算。
CalibAtt在哪些模型上进行了实验?效果如何?
CalibAtt在Wan 2.1 14B、Mochi 1以及少步蒸馏模型上进行了实验,在不同分辨率下实现了最高1.58倍的端到端加速,同时保持了视频生成质量和文本-视频对齐。
CalibAtt与现有无需训练的方法相比有何优势?
CalibAtt在实验中优于现有的无需训练方法,在保持生成质量的同时实现了更高的端到端加速。
CalibAtt是否适用于所有文本到视频生成模型?
文章未明确说明其通用性,但实验涵盖了多个模型(Wan 2.1、Mochi 1等),表明其具有较好的适用性。具体是否适用于所有模型需进一步验证。