2D Triplane 和 3D 小波表示的混合视频扩散模型

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

本文介绍了一种基于转换器的W.A.L.T方法,用于逼真视频生成。通过因果编码器在统一的潜在空间中联合压缩图像和视频,并使用窗口注意力架构进行联合空间和时空生成建模,实现了最先进的性能。同时,还训练了三个模型的串联,用于文本到视频生成任务。

🏷️

标签

➡️

继续阅读