Text-Animator: 可控的视觉文本视频生成
内容提要
本文介绍了一种新的视频生成任务TI2V,利用静态图像和文本描述生成视频。提出的MAGE视频生成器采用运动锚结构,支持可控性和多样性。研究展示了多种基于文本生成视频的方法,如Text2Performer和ControlVideo,均在生成质量和时间一致性方面表现优异。最新的T2AV-Bench基准和T2AV模型在视觉对齐和时间一致性上设立了新标准。
延伸解读
TI2V任务与MAGE生成器
文章提出了一种新的视频生成任务TI2V,即从静态图像和文本描述生成视频。为完成该任务,研究者设计了MAGE视频生成器,其核心是运动锚(MA)结构,用于存储外观-运动对齐表示,并通过三维轴向变压器与给定图像交互。这种设计支持生成视频的可控性和多样性。两个新的视频-文本匹配数据集验证了MAGE的有效性,并展示了TI2V任务的潜力。
文本到视频生成的技术演进
文章回顾了多个文本到视频生成方法。Text2Performer基于文本描述生成拥有精细动作的逼真人类视频,并提供了Fashion-Text2Video数据集,通过将VQVAE潜空间表示细分为人物形象和姿势表示,以及连续VQ-diffuser采样姿势编码,实现了更好的动作建模。ControlVideo是一种无需训练的文本驱动扩散模型,使用三个模块实现外观协调、帧插值和分层采样,能在几分钟内生成高质量短视频和长视频。此外,还有基于查询文本描述运动结构合成视觉讲述视频的技术,以及使用文本作为上下文描述和动作结构作为具体指
多文本视频生成与视觉一致性
针对视频生成中多文本条件需要结合顺序事件的特点,文章介绍了一种新的多文本视频生成模型。该模型直接利用预训练的基于扩散的文本到视频转换模型进行生成,无需额外微调。为了生成连续的视频片段,不同提示生成的视觉一致性是必要的,同时需要处理运动和内容相关的过渡。该方法包括动态噪声和最后一帧感知反演,用于在不同提示的视频之间重新初始化噪声潜变量,以保持视觉一致性并防止重复运动或内容。此外,结构导向采样用于在单个视频剪辑的帧之间保持全局外观,提示生成器允许任意格式的文本条件。实验证明该方法在语义一致性和时间连续性方面具有出色的生
T2AV-Bench基准与T2AV模型
文章提出了一个名为T2AV-Bench的创新基准和一个简单而有效的视频对齐文本到音频生成模型T2AV。T2AV通过整合视觉对齐的文本嵌入到生成模型中,利用时间多头注意力转换器从视频数据中提取和理解时间细微差异,并通过Audio-Visual ControlNet将时态视觉表示与文本嵌入精确融合,以增强集成性,确保视觉对齐和时间一致性。经过对AudioCaps和T2AV-Bench的广泛评估,T2AV在视觉对齐和时间一致性上设立了新的标准。
Q&A
TI2V是什么视频生成任务?
TI2V是一种从静态图像和文本描述生成视频的新任务。
MAGE视频生成器的创新之处是什么?
MAGE视频生成器采用运动锚结构,支持可控性和多样性。
Text2Performer算法的主要功能是什么?
Text2Performer算法基于文本描述生成逼真的人类视频,表现出色。
ControlVideo模型的优势是什么?
ControlVideo是一种无需训练的文本到视频生成模型,能够快速生成高质量视频。
T2AV-Bench基准的意义是什么?
T2AV-Bench基准在视觉对齐和时间一致性上设立了新标准。
如何实现视频生成的时间一致性?
通过动态噪声和结构导向采样等方法,可以在视频生成中保持时间一致性。