内容提要
Roblox采用混合架构,将游戏引擎与视频世界模型结合,实现照片级真实感。引擎负责世界一致性、规则和物理,模型负责生成精细纹理和光照。通过自强制、边缘GPU和上下文扩展解决延迟、一致性和多人问题。目标是让小型创作者也能制作高质量游戏,早期版本预计今年或明年初推出。
延伸解读
混合架构的核心理念
Roblox Reality将游戏引擎与视频世界模型结合,引擎负责世界一致性、规则和物理,模型负责生成精细纹理和光照。这种分工让模型专注于像素生成,而推理和逻辑由引擎承担,避免了单一技术的短板。
延迟与一致性的技术挑战
视频模型生成一帧需数秒,而游戏需要每帧几十毫秒。Roblox通过自强制技术将离线模型转为自回归生成,并压缩KV缓存、使用边缘GPU来降低延迟。同时,通过扩展上下文窗口和检索相关对象,保持长时间会话中的世界一致性。
多人同步与创作者控制
多人游戏中,引擎作为服务器权威,计算共享状态,每个玩家的模型基于该状态生成个性化视图,并通过客户端预测减少延迟。创作者控制方面,Lucid AI的游戏卡带封装了确定性逻辑,使模型在生成外观的同时遵循固定规则,玩家输入通过条件信号影响生成。
成本与可及性的前景
由于渲染在边缘GPU上完成,创作者无需高端设备即可制作高质量游戏,降低了门槛。早期版本预计今年或明年初推出,目标为2K/60fps,4K为长期目标。但成本与规模化仍是待解问题。
Q&A
Roblox Reality的混合架构是如何工作的?
Roblox Reality由游戏引擎、Roblox Cloud和视频世界模型(Super Upsampler)三部分组成。游戏引擎负责维护世界状态、规则和物理,生成低质量的渲染帧和场景数据;Roblox Cloud负责存储状态和运行大规模会话;Super Upsampler则根据引擎提供的信号(如深度图、光照、物体描述)生成照片级真实感的纹理和细节。这样分工使得引擎处理精确但昂贵的部分,模型处理模糊但昂贵的部分,从而降低成本。
为什么单独使用视频世界模型或游戏引擎都不够?
视频世界模型虽然能生成逼真的图像,但缺乏游戏所需的持久状态、一致规则和物理模拟,无法保证世界在视角变化后保持一致,也无法处理多人交互。游戏引擎虽然能精确管理状态和物理,但实现照片级真实感需要大量计算资源,导致成本高昂,普通创作者和玩家难以承受。因此,两者结合才能兼顾真实感和可玩性。
Roblox如何解决视频世界模型的延迟问题?
Roblox采用自强制(self-forcing)技术,将离线视频模型转换为自回归模型,逐帧生成,从而将延迟从约5秒降低到接近30毫秒。此外,还通过缩小模型规模、压缩键值缓存、使用边缘GPU(如H200和B200)靠近玩家部署,以及优化网络路径来进一步降低延迟。
Roblox如何保证多人游戏中的世界一致性?
游戏引擎作为服务器权威,计算一个共享的真实状态,所有玩家都基于这个状态生成自己的视图。每个玩家的视频模型根据共享状态生成个性化视角,但事实保持一致。此外,系统在玩家设备上运行快速预测模拟以即时响应操作,服务器随后确认权威结果。未来可能将玩家自己的头像本地渲染并叠加到流式视频上,以增强即时感。
Roblox如何让创作者控制视频世界模型?
Roblox通过Lucid AI开发的游戏卡带框架(game cartridge harness)将确定性游戏逻辑包裹在视频世界模型周围,使世界看起来是生成的,但行为遵循创作者设定的固定规则。玩家的操作(如WASD)作为条件输入,直接驱动生成的视图。创作者未来可能通过文本提示或数据模型来控制模型,具体方式仍在研究中。
Roblox Reality的早期版本预计何时推出?目标是什么?
早期版本预计今年或明年初推出,首要质量目标是2K分辨率、60帧每秒,长期目标是4K。该版本将先解决成本和扩展问题,才能支持大量玩家。
Roblox Reality对小型创作者有什么意义?
由于重型渲染在共享边缘GPU上完成,而不是在创作者或玩家的设备上,视觉质量不再受团队预算或设备性能限制。小型工作室(如两人团队)也能在普通设备上制作出高质量的游戏,无需在复杂度和视觉质量之间取舍。
Roblox在基础设施方面有哪些优势?
Roblox拥有超过二十个边缘数据中心和自己的GPU,而不是租用云服务,这有助于低延迟运行视频模型。此外,它通过每周的“Taco Tuesday”压力测试来确保系统在突发流量下稳定,可靠性被视为每个人的责任,高管也参与值班。