Accelerating Text-to-Video Generation with Calibrated Sparse Attention

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

💡 原文英文,约400词,阅读约需2分钟。
📝

内容提要

Recent diffusion models enable high-quality video generation, but suffer from slow runtimes. The large transformer-based backbones used in these models are bottlenecked by spatiotemporal...

➡️

继续阅读