内容提要
生数科技发布Vidu S2,包含Avatar和Editing两个模型。Avatar数字人支持语音控制动作、实时接收参考图,分辨率提升至720p;Editing支持视频边播边换装、换人、换背景、换画风,并支持实时空间视频。模型采用两阶段架构、时间戳对齐与强化学习,发布即全量开放。
延伸解读
实时交互视频的技术门槛
Vidu S2的实时交互能力要求模型生成速度必须跑赢播放速度,否则会出现卡顿。团队通过SageAttention等技术提速,并利用多GPU协同调度减少等待,从而在720p输出下保持流畅。这体现了实时视频生成与离线生成在技术路径上的根本差异,也解释了为何实时交互视频的研发难度更高。
视频实时编辑的实用性与局限
Vidu S2-Editing支持边播边换装、换人、换背景和换画风,在实测中服装形变和人物一致性表现良好,但仍有细节瑕疵,如色块涂抹感和头发穿模。这些局限提示用户,在追求创意效果的同时,需对复杂场景下的编辑质量保持合理预期,尤其是涉及精细纹理或快速运动时。
空间视频的现状与挑战
Vidu S2支持实时生成和编辑空间视频,用户可将普通视频转为空间视频,或通过头显摄像头以真实世界为画布创作。然而,头显对分辨率和延迟要求极高,画面模糊或延迟会导致眩晕和视觉冲突,团队坦言仍在优化中。目前空间视频需在Apple Vision Pro等设备上观看,普通设备仅显示二维画面。
训练策略与架构创新
Vidu S2采用Backbone-Refiner两阶段架构,Backbone生成低分辨率主体结构,Refiner异步精修细节,实现720p不掉帧。通过时间戳对齐,模型能根据用户中途提供的参考图,从指定时间点平滑过渡生成条件。此外,Self-Replay Forcing和强化学习(DPO、Streaming NFT)提升了流式生成的稳定性和指令遵循能力。
Q&A
Vidu S2是什么?它包含哪些模型?
Vidu S2是生数科技发布的AI视频生成模型,包含两个细分模型:Vidu S2-Avatar(实时交互模型,支持语音对话、语音控制数字人做动作、实时交互中输入参考图)和Vidu S2-Editing(实时视频编辑模型,可以改变服装、人物、背景和视频风格)。
Vidu S2-Avatar相比上一代S1有哪些升级?
Vidu S2-Avatar将实时输出分辨率从540p提升到720p,数字角色面部和衣服细节更丰富;数字人能执行更复杂的动作(如跳舞、转圈、跺脚),而S1主要限于聊天互动;还支持在互动过程中实时接收参考图,让数字人拿起指定物品、换衣服或进入新场景。
Vidu S2-Editing能实现哪些实时视频编辑功能?
Vidu S2-Editing提供四类实时编辑能力:改变服装、更换人物、更换背景和转换视频风格。这些编辑可以在视频播放过程中实时进行,保持动作连贯和面部一致性。
Vidu S2如何实现实时空间视频?
基于Vidu S2-Avatar,用户可以实时生成空间视频;基于Vidu S2-Editing,用户可以实时编辑空间视频。用户能把普通视频实时转成空间视频,还能将头显摄像头看到的真实物理世界作为画布进行创作。空间视频需在支持空间计算的设备(如Apple Vision Pro)上观看。
Vidu S2在技术上是如何实现实时交互和编辑的?
Vidu S2采用Backbone-Refiner两阶段架构:Backbone在低分辨率下生成主体结构、运动和语义,Refiner负责细节精修,通过异步流水线并行处理,保证720P输出不掉帧。换装、换背景等编辑通过时间戳对齐实现,将参考图注入位置与时间戳对齐,使新条件从指定时间点生效。此外还引入VLM Agent跟踪画面状态,并采用强化学习(DPO和Streaming NFT)优化生成质量。
Vidu S2发布后如何获取和使用?
Vidu S2发布当天即全量开放,不搞内测、不限名额。用户可以通过体验链接 https://vidu.cn/vidu-stream 立即体验,API平台为 http://platform.vidu.cn/vidu-stream/doc,技术报告见 https://arxiv.org/pdf/2609.11638。