利用校准稀疏注意力加速文本到视频生成

利用校准稀疏注意力加速文本到视频生成

💡 原文英文,约400词,阅读约需2分钟。
📝

内容提要

本文介绍CalibAtt,一种无需训练的加速文本到视频生成方法。它通过离线校准识别注意力中的稀疏和重复模式,在推理时跳过不重要的token连接,实现硬件高效计算。实验表明,在Wan 2.1等模型上,CalibAtt可提升端到端速度达1.58倍,同时保持视频质量和文本对齐。

🔎

延伸解读

核心观察:注意力中的稀疏与重复模式

文章指出,在文本到视频生成的扩散模型中,注意力计算存在大量得分极低的token连接,且这些模式在不同输入间常重复出现。这意味着许多计算是冗余的,跳过它们对生成结果影响甚微。这一发现不仅适用于全局token,也适用于局部token块,为后续的加速方法提供了理论基础。

CalibAtt的加速机制

CalibAtt通过离线校准阶段识别出稳定的块级稀疏性和重复模式,并将其编译为针对每个层、头和扩散时间步的优化注意力操作。推理时,仅密集计算选中的输入相关连接,跳过未选中的部分,并以硬件高效方式实现。这种方法无需训练,直接应用于现有模型,如Wan 2.1 14B和Mochi 1,在多种分辨率下均有效。

性能与质量权衡

实验表明,CalibAtt在Wan 2.1等模型上可实现高达1.58倍的端到端加速,同时保持视频生成质量和文本-视频对齐。相比其他无需训练的方法,CalibAtt在加速效果上更优,且不牺牲生成质量。这为实际应用中部署高质量视频生成模型提供了更高效的解决方案。

Q&A

CalibAtt是什么?它如何加速文本到视频生成?

CalibAtt是一种无需训练的加速文本到视频生成的方法。它通过离线校准识别注意力中的稀疏和重复模式,在推理时跳过不重要的token连接,实现硬件高效计算,从而加速生成过程。

CalibAtt的核心观察是什么?

CalibAtt的核心观察是:在文本到视频生成模型的注意力机制中,很大一部分token之间的连接得分始终很低,且这些模式在不同输入间重复出现。因此,这些计算可以跳过而不影响结果。

CalibAtt是如何实现无需训练加速的?

CalibAtt通过离线校准阶段识别块级别的稀疏性和重复模式,这些模式在不同输入间稳定,然后为每一层、每个头和每个扩散时间步编译成优化的注意力操作。推理时,只计算选中的输入相关连接,跳过未选中的,从而实现硬件高效计算。

CalibAtt在哪些模型上进行了实验?效果如何?

CalibAtt在Wan 2.1 14B、Mochi 1以及少步蒸馏模型上进行了实验,在不同分辨率下实现了最高1.58倍的端到端加速,同时保持了视频生成质量和文本-视频对齐。

CalibAtt与现有无需训练的方法相比有何优势?

CalibAtt在实验中优于现有的无需训练方法,在保持生成质量的同时实现了更高的端到端加速。

CalibAtt是否适用于所有文本到视频生成模型?

文章未明确说明其通用性,但实验涵盖了多个模型(Wan 2.1、Mochi 1等),表明其具有较好的适用性。具体是否适用于所有模型需进一步验证。

🏷️

标签

➡️

继续阅读