ModelScopeT2V是一个文本到视频合成模型,通过时空块确保帧生成和运动过渡的一致性。该模型适用于不同帧数量的图像-文本和视频-文本数据集,具有17亿参数,其中5亿参数用于时序能力。在三个评估指标上表现出优越性能,优于现有方法。
完成下面两步后,将自动完成登录并继续当前操作。