通过 Transformer 实现的简单文本到视频模型
原文中文,约300字,阅读约需1分钟。
📝
内容提要
该文介绍了一种基于Transformer的文本到视频模型,使用U-Net从噪音版本重构图像,并使用GPT2在UCF101数据集上进行测试,展示其能够生成有希望的视频。
🏷️