Cavia:可控相机的多视角视频扩散与视图集成注意力

Cavia:可控相机的多视角视频扩散与视图集成注意力

💡 原文英文,约200词,阅读约需1分钟。
📝

内容提要

近年来,图像到视频生成取得显著进展,但3D一致性和相机可控性问题仍未解决。为此,我们提出了Cavia框架,能够将输入图像转换为多个时空一致的视频,支持精确控制相机运动,同时保持物体运动。实验结果表明,Cavia在几何一致性和感知质量上优于现有方法。

🎯

关键要点

  • 近年来,图像到视频生成取得显著进展。
  • 3D一致性和相机可控性问题仍未解决。
  • 现有研究尝试将相机控制纳入生成过程,但结果有限。
  • Cavia框架能够将输入图像转换为多个时空一致的视频。
  • Cavia支持精确控制相机运动,同时保持物体运动。
  • Cavia扩展了空间和时间注意模块,提升了视角和时间一致性。
  • Cavia是首个允许用户精确控制相机运动生成同一场景多个视频的框架。
  • 实验结果表明,Cavia在几何一致性和感知质量上优于现有方法。
➡️

继续阅读