Runway 披露即时视频生成研究路线:从 “等待出片” 走向 “边提示边出片”

Runway 披露即时视频生成研究路线:从 “等待出片” 走向 “边提示边出片”

💡 原文中文,约1700字,阅读约需4分钟。
📝

内容提要

Runway发布实时视频生成研究,提出自回归因果扩散与两阶段蒸馏路线,使模型逐帧流式输出,将创作从等待转为即时执导。技术分教师强制与学生强制两步,蒸馏先离线后在线,并采用递增序列长度课程训练。实时生成使计算瓶颈转向推理,可推动交互式媒体与智能体模拟等应用。

🔎

延伸解读

实时生成如何改变成本结构

Runway 指出,即时生成不仅提升创作效率,还改变了成本结构:模型运行更快意味着占用更少的 GPU 时间。在给定质量水准下,每个输出的成本决定了用例的可行性。实时生成将把这一门槛进一步推高,让原本不具备成本效益的用例进入可落地范围。这意味着,实时能力可能催生新的应用场景,而不仅仅是优化现有流程。

两阶段蒸馏:从离线到在线的关键

Runway 采用两阶段蒸馏实现实时运行:先离线策略,再在线策略。离线策略下,学生基于真实上下文因果预测下一状态,由冻结的双向教师模型示范,训练开销较低,但视频领域的错误会逐帧累积、迅速导致模型偏离分布。在线策略则在训练内部执行 rollout,让学生看到自己生成的上下文并主动纠正漂移,与推理阶段完全等价。这种设计旨在平衡训练效率与生成稳定性。

计算瓶颈转移与基础设施挑战

实时生成把计算瓶颈从训练转移到了推理:每一帧都必须以足够快的速度离开模型,以跟上播放节奏,且要在共享硬件上支撑并发会话。Runway 表示,正在沿用其生产系统的评估方式,通过内部评估与可观测性工具,并排对比不同 checkpoint 与硬件配置下的生成质量和延迟。这表明,实时视频生成对推理基础设施提出了更高要求,可能影响其部署与扩展。

应用前景:交互式媒体与智能体模拟

Runway 认为,即时生成是交互式体验的基础,而交互式体验最终将成为生成式媒体最大的用例。教育、游戏、机器人等领域都将依赖响应速度跟得上观看者的视频;模拟场景同样如此:评估机器人、自动驾驶等物理智能体在真实世界中的行为,需要能够实时生成并对边缘情况即时响应的环境,数字智能体执行复杂计算机使用任务同理。这一判断正在驱动 Runway 当前的基础研究。

Q&A

Runway 提出的即时视频生成技术路线是什么?

Runway 提出以自回归因果扩散与两阶段蒸馏为核心的技术路线,使视频模型能够逐帧流式输出内容,将创作者从“输入提示词后被动等待”转向“边提示边执导”。

Runway 如何实现视频的实时流式生成?

Runway 对基础模型进行后训练,每个自回归步骤以初始首帧和用户提示词为条件,逐帧生成并将已生成的 latent 保留在上下文中,视频与音频解码器以因果方式运行,在 latent 生成的同时流式输出结果。

两阶段蒸馏具体包含哪些步骤?

第一步是“教师强制”,将整个模型架构改造成时间因果、逐帧自回归的生成器;第二步是“学生强制”,通过分布匹配蒸馏把每帧所需的去噪步数压缩到个位数,从而以可接受的延迟实现流式输出。

离线策略和在线策略蒸馏有什么区别?

离线策略下,学生基于真实上下文因果预测下一状态,由冻结的双向教师模型示范优质生成,训练内存与步时开销较低,但错误会逐帧累积导致模型偏离分布;在线策略则在训练内部执行 rollout,让学生看到自己生成的上下文并主动纠正漂移,与推理阶段完全等价。

实时视频生成对计算基础设施有什么影响?

实时生成把计算瓶颈从训练转移到了推理:每一帧都必须以足够快的速度离开模型,以跟上播放节奏,且要在共享硬件上支撑并发会话。Runway 正在沿用其生产系统的评估方式,通过内部评估与可观测性工具,并排对比不同 checkpoint 与硬件配置下的生成质量和延迟。

即时视频生成有哪些应用前景?

Runway 认为,即时生成是交互式体验的基础,而交互式体验最终将成为生成式媒体最大的用例。教育、游戏、机器人等领域都将依赖响应速度跟得上观看者的视频;模拟场景同样如此:评估机器人、自动驾驶等物理智能体在真实世界中的行为,需要能够实时生成并对边缘情况即时响应的环境,数字智能体执行复杂计算机使用任务同理。

🏷️

标签

➡️

继续阅读