论文周报丨Vidu S2实现实时720P数字人生成与视频编辑;NCP-ArchPreview探索LLM隐空间预训练新范式...速览一周AI前沿论文

论文周报丨Vidu S2实现实时720P数字人生成与视频编辑;NCP-ArchPreview探索LLM隐空间预训练新范式...速览一周AI前沿论文

💡 原文中文,约5500字,阅读约需14分钟。
📝

内容提要

清华大学与生数科技推出 Vidu S2,包含 Avatar 和 Editing 两个模型,支持实时 720p 数字人生成、动态参考图更新、视频流风格迁移、虚拟试穿、人物与背景替换,以及实时空间视频生成。本周还推荐了 NCP-ArchPreview、SenseNova-U1.5、Benchmark Radar、Atria Dawn、Dream-RSI 等 8 篇 AI 前沿论文。

🔎

延伸解读

实时视频生成的技术突破

Vidu S2-Avatar 实现了实时 720p 数字人生成,并支持动态参考图更新和更强的动作指令遵循。这意味着数字人能够根据指令实时完成跳舞等复杂动作,为直播、虚拟互动等场景提供了低延迟、高质量的解决方案。与离线生成相比,实时性大幅提升了交互体验,但具体延迟数据和硬件需求未在文中披露。

视频编辑的实时化与空间化

Vidu S2-Editing 将实时能力拓展到视频编辑,支持风格迁移、虚拟试穿、人物替换和背景替换,并兼容单目与立体视频输入。研究团队还探索了实时空间视频生成,可将单目视频转换为同步左右眼视图,为 VR 场景提供实时空间视频体验。这些功能展示了视频编辑从后期处理向实时交互的转变。

隐空间语言模型的新范式

NCP-ArchPreview 将下一概念预测引入语言模型预训练,在词元级预测之外学习跨越多个词元的离散概念。在 8.9B 参数、5.73 万亿词元规模下,仅使用 51.3% 的训练词元即可达到 OLMo-3-7B 的最终预训练损失,下游任务宏平均性能提升 2.45 分,GSM8K 提升 5.99 分。概念空间还可用于轻量级领域适应和推测解码。

持续学习与长期记忆的挑战

针对语言模型在持续学习中的灾难性遗忘问题,研究提出长期记忆评测设定,并组合数据锚、函数锚、权重锚与合并 LoRA 等机制。实验显示,最佳组合将平均最终信息保留率从朴素顺序微调的 1.2% 提升至 34.9%,实现约 28 倍提升。这表明单一机制难以维持长期记忆,而互补机制的组合能显著缓解遗忘。

Q&A

Vidu S2 是什么?它包含哪些模型?

Vidu S2 是清华大学与生数科技联合推出的视频生成模型,包含 Vidu S2-Avatar 和 Vidu S2-Editing 两个模型,分别面向实时数字人生成和视频流编辑。

Vidu S2-Avatar 有哪些主要功能?

Vidu S2-Avatar 支持实时 720p 视频生成、动态参考图随时更新以及更强的动作指令遵循能力,让数字人能够根据指令实时完成跳舞等复杂动作。

Vidu S2-Editing 能实现哪些视频编辑操作?

Vidu S2-Editing 支持对输入视频流进行风格迁移、虚拟试穿、人物替换和背景替换,并兼容单目与立体视频输入。

Vidu S2 在实时空间视频生成方面有什么应用?

Vidu S2 可将生成或编辑后的单目视频转换为同步的左右眼视图,为 VR 等场景提供实时空间视频体验。

NCP-ArchPreview 的主要创新点是什么?

NCP-ArchPreview 将下一概念预测(NCP)引入语言模型预训练,在标准下一词元预测(NTP)之外,进一步学习跨越多个词元的离散概念。该模型通过隐藏状态构建乘积量化概念词汇表,并联合训练概念级与词元级预测,在 8.9B 参数、5.73 万亿词元规模下验证了隐空间语言模型的大规模训练可行性。

NCP-ArchPreview 在实验中取得了哪些效果?

NCP-ArchPreview 仅使用 51.3% 的训练词元即可达到 OLMo-3-7B 的最终预训练损失,完整训练后下游任务宏平均性能提升 2.45 分,GSM8K 提升 5.99 分。此外,学习到的概念空间还可用于轻量级领域适应和推测解码,仅更新 1700 万参数即可进行领域适配,将概念表示注入 DFlash2 草稿器后,平均接受长度提升 4.17%。

Benchmark Radar 是什么?它提供了哪些功能?

Benchmark Radar 是一个面向 AI 基准测试的动态数据库与搜索引擎,持续汇集基准论文、代码、数据集及发布版本,覆盖 LLM、智能体、编程、推理、安全等评测领域。系统目前接入 37 个信息源,已收录 1,283 条基准记录和 12,916 条分数观测,并保留来源与引用信息。它不仅提供基准检索,还整合了分数历史、采用趋势和基准饱和度分析,同时提供排行榜、帕累托前沿、每日信息流、可下载证据和 CLI 等工具。

Atria Dawn Preview 是什么?它在哪些方面表现出色?

Atria Dawn Preview 是复旦大学研究人员推出的面向科学研究与工程工作流的基础智能体语言模型,通过可验证经验流水线,将工具交互、可执行环境与外部验证结果结合起来训练。模型在涵盖科研、工程和数字工作的 16 项基准测试中展现出竞争力,并在其中 5 项取得最高报告分数。

Dream-RSI 如何实现递归自我改进?

Dream-RSI 通过轻量级编排层将探索策略显式化、可编程化,同时无需修改底层编码 Agent。其核心思路是将累积的发现历史构建为回放模拟器,让 Agent 在“梦境”中以低成本获得离策略反馈,并据此持续优化探索策略。改进后的策略随后重新部署到线上,推动新一轮发现,并不断扩充历史模拟器,形成递归自我改进闭环。

长期记忆(Long-Horizon Memorization)研究发现了什么?如何提升记忆保留率?

研究团队构建了包含 100 个连续查询-答案任务的三个数据集,发现模型在顺序微调过程中会出现严重的灾难性遗忘,而现有单一持续学习机制难以在长时间跨度内维持稳定记忆。为此,研究团队将数据锚、函数锚、权重锚与合并 LoRA 等互补机制进行组合,并通过任务级连续减半系统搜索有效方案。实验显示,最佳组合在三个数据集上均进入前三,将平均最终信息保留率从朴素顺序微调的 1.2% 提升至 34.9%,实现约 28 倍提升,其中数据锚与合并 LoRA 带来的增益最为明显。

🏷️

标签

➡️

继续阅读