内容提要
HelixWorld 1.0是Noiz AI联合多机构发布的实时可交互音视频世界模型,支持24 FPS画面与48kHz双声道音频同步生成。它通过原生Transformer架构统一生成声画,并采用因果化、KV Cache等技术实现实时响应。团队计划数周内完全开源模型权重和代码,旨在推动世界模型生态发展。
延伸解读
声音为何是世界模型的关键短板
传统视频生成模型只输出固定画面,无法交互,而世界模型虽已实现实时视觉交互,却普遍缺乏同步声音。HelixWorld 1.0 的发布填补了这一空白,它通过原生 Transformer 架构统一生成画面与音频,支持 24 FPS 和 48kHz 立体声,让声音随用户操作实时变化,从而提升沉浸感。
数据清洗与对齐的挑战
构建音视频世界模型的最大难点在于数据:现有数据集缺乏声音的空间信息、动作对应关系。团队从真实世界和游戏世界双路采集,真实数据保真,游戏数据提供精确空间标注。清洗时需去除伪立体声、后期配乐,并逐帧校验声像位置与画面事件的对齐,确保声音与画面在时间和空间上一致。
实时生成的技术突破
为实现实时交互,HelixWorld 将双向模型改造为因果模型,仅依赖过去信息,并通过 KV Cache 复用历史计算。训练时引入自生成历史,让模型学会在误差累积下继续生成。蒸馏阶段结合轨迹蒸馏与 DMD,避免少步生成带来的过曝问题,最终将去噪步数压缩至个位数,实现边生成边输出。
开源与未来方向
团队计划数周内完全开源模型权重和代码,旨在推动生态发展。文章指出,世界模型下一步将迈向多智能体、多人现场、超长时间一致性和自主进化,这些方向将重塑游戏、互动影视和教育等场景。开源不仅分享技术,也为收集反馈和构建社区奠定基础。
Q&A
HelixWorld 1.0是什么?它有什么特点?
HelixWorld 1.0是Noiz AI联合多机构发布的实时可交互音视频世界模型,支持24 FPS画面与48kHz双声道音频同步生成,能根据用户操作实时渲染和生成声音与画面。
HelixWorld 1.0如何实现声音和画面的同步生成?
HelixWorld 1.0采用原生Transformer架构,将音频和视频的latent表征输入同一套Transformer联合生成,并持续交换信息,确保声音和画面从一开始就绑定在一起,共同响应动作。
HelixWorld 1.0的训练数据是如何构建的?
训练数据来自真实世界和游戏世界。真实世界数据主要来自公开网络视频,尤其是第一人称连续行走素材,保证声画天然对齐;游戏世界数据则提供精确的空间关系,如几何、材质、声源位置等。数据经过清洗和声画对齐校验,最终得到百万量级训练片段。
HelixWorld 1.0如何实现实时生成?
HelixWorld 1.0通过将双向预训练模型改造为因果模型,只允许查看过去,并利用KV Cache复用历史信息,逐块自回归生成。同时采用轨迹蒸馏和DMD结合的方法减少去噪步数,配合KV Cache和逐块生成,实现实时响应。
HelixWorld 1.0的开源计划是什么?
HelixWorld 1.0的模型权重和代码将在接下来几周完全开源,仓库链接为https://github.com/NoizAI/HelixWorld。
HelixWorld 1.0相比传统视频生成模型有什么优势?
传统视频生成模型生成固定预设的视频,无法交互;而HelixWorld 1.0支持实时交互,用户操作会同时影响画面和声音,且声音与画面同步生成,提供更沉浸的体验。
HelixWorld 1.0未来的发展方向有哪些?
未来方向包括多智能体(每个角色有自己的身份、目标和记忆)、多人现场(区分说话人、理解对话场景)、超长时间一致性(保持身份、记忆、空间状态一致)以及世界的自主进化(无需Prompt也能持续运行)。