内容提要
影眸Hyper3D发布世界生成模型WorldGen,可将单张场景图在2-3分钟内生成可交互、可编辑的完整3D场景,每个资产独立且带物理属性。基于SIGGRAPH最佳论文CAST技术,WorldGen服务于具身智能、游戏、影视和XR领域,支持场景拆解、物理仿真及导入主流引擎,推动3D生成进入场景级时代。
延伸解读
从“造物”到“造世界”:3D生成的关键跃迁
WorldGen将3D生成从单个资产提升到完整场景,核心在于场景被拆解为独立资产,并保留空间与物理关系。这意味着生成结果不再是不可拆分的整体,而是可编辑、可交互的“乐高积木”,为后续生产流程提供了可用的起点。
技术基座:SIGGRAPH最佳论文CAST
WorldGen基于影眸Hyper3D自研的CAST技术,该技术获得SIGGRAPH 2025最佳论文。CAST通过对象识别、遮挡补全、空间放置和物理校正四步,解决单图生成场景中的深度缺失、遮挡和物理一致性难题,为WorldGen的产品化奠定了基础。
行业落地:从具身智能到影视制作
WorldGen已应用于具身智能、游戏、影视和XR领域。例如,与地瓜机器人、谋先飞合作构建仿真闭环;游戏资产可直接导入Blender、Unity等引擎;影视制作中与Seedance 2.5结合,实现可控场景与高质量视频生成的互补。
局限与展望:仍需人工精修
尽管WorldGen能快速生成场景,但距离最终成品仍有差距。生成结果需要专业创作者进一步编辑和精修,如材质调整、动画绑定等。其价值在于提供可编辑的起点,而非直接生成可上线的游戏或电影。
Q&A
影眸科技发布的WorldGen是什么?它和普通的3D生成模型有什么不同?
WorldGen是影眸科技发布的世界生成模型,它能够将单张场景图在2-3分钟内生成一个可交互、可编辑的完整3D场景。与普通3D生成模型只能生成单个物体不同,WorldGen生成的是场景级内容,每个物体都是独立资产,具有物理属性,可以单独操作和替换。
WorldGen的技术基础是什么?它获得了哪些荣誉?
WorldGen的技术基础是影眸科技自研的场景级生成技术CAST,该技术获得了SIGGRAPH 2025最佳论文奖,同期获奖的商业公司只有谷歌和Meta。
WorldGen是如何工作的?请简述其生成流程。
WorldGen的生成流程包括:上传场景图后,系统自动识别或手动框选主要物体,然后逐个生成每个前景物体作为独立资产(约2-3秒出预览),背景环境用3D Gaussian Splatting补全,整体耗时2-3分钟。开启SimReady模式后,系统会为每个资产补充碰撞体并估计质量、摩擦系数等物理属性。
WorldGen在具身智能领域有哪些应用?
WorldGen在具身智能领域可用于生成机器人训练所需的仿真环境。例如,影眸科技与地瓜机器人、谋先飞合作,利用WorldGen从真实影像生成可交互的3D场景,结合谋先飞的MotrixSim引擎进行物理仿真,地瓜机器人提供算力,形成从场景准备到策略验证的完整闭环。此外,WorldGen还支持将整个场景用于NVIDIA Isaac Sim。
WorldGen对游戏和影视制作有什么帮助?
在游戏领域,WorldGen可以从概念图生成对象化场景,策划可检查动线和空间,关卡设计师可移动或替换道具,生成资产可直接导入Blender、Unity等引擎进行二次创作。在影视领域,WorldGen可作为可控3D基底,导演可轻松调整物体位置,再结合视频生成模型提升画面质量,例如与Seedance 2.5结合使用,实现镜头调度和风格变换。
WorldGen解决了传统场景生成的哪些痛点?
传统场景生成通常将整个场景作为一个模型生成,导致内容不可拆解,用户难以编辑。WorldGen将场景拆解为独立资产,保留空间和物理关系,使每个物体可单独操作,解决了场景不可编辑、不可复用的问题。
WorldGen的CAST技术是如何处理场景生成的?
CAST技术分为四步:1)将输入图片拆解为对象并估计相对深度;2)针对每个物体独立生成完整3D几何,利用遮挡感知补全不可见区域;3)将物体放回统一空间,估计旋转、平移和尺度以保持构图一致;4)建立物体关系图,结合SDF进行物理校正,减少穿透和悬空。
WorldGen为什么被称为“世界生成模型”而不是“世界模型”?
影眸科技CTO张启煊解释,世界生成模型是通过文本或图像将场景还原为可用的三维世界,它生成开放式场景,更接近“世界”的表达。它仍是广义世界模型的重要组成部分,因为真正的世界模型需要载体来承载世界的外观和属性,而影眸选择的载体是3D。