内容提要
MirroS团队发布AgentGarten,将代码物理环境与神经渲染器结合,让智能体在可交互世界中反复试错。捉迷藏实验中,躲藏者第4轮学会搭掩体,搜寻者第10轮学会翻墙,远快于传统强化学习。智能体通过撰写实验手册复盘经验,实现跨任务迁移,探索物理世界的递归自我改进。
延伸解读
代码与神经渲染的分工逻辑
AgentGarten将物理规则交给代码,光影渲染交给神经模型,形成明确分工。代码环境负责碰撞检测与状态更新,确保物理确定性;神经渲染器则基于几何草图生成逼真画面。这种设计既避免了视频世界模型的“幻觉物理”,又绕开了传统引擎高昂的美术成本,让环境扩展从劳动密集型转向程序化。
实验手册驱动的快速学习
智能体通过撰写实验手册复盘经验,实现跨轮次策略积累。在捉迷藏实验中,躲藏者第4轮学会搭掩体,搜寻者第10轮学会翻墙,远快于传统强化学习所需的数千万局。手册区分观察与猜测,并标注防坑指南,使有效经验被继承,失效教训催生新策略分支,形成可迁移的学习闭环。
实时渲染的技术挑战与突破
为支撑闭环交互,神经渲染器需解决流式生成、长程稳定与实时速度三大难题。团队采用Adversarial Forcing训练、精确重放机制和真实视频对抗,避免画面漂移与伪影;同时通过定制Triton算子、CUDA Graph和轻量解码器,在480p分辨率下实现30 fps以上吞吐,确保智能体看清结果再决策。
从捉迷藏到通用具身智能
AgentGarten的探索—复盘—沉淀循环已在翼装飞行、机械臂操作、厨房烹饪、多车竞速等任务中验证。代码世界可编程生成,渲染器提供逼真反馈,手册沉淀经验,三者结合指向Physical RSI(物理世界递归自我改进)。这为通用具身智能提供了可扩展的试炼场,但当前仍限于虚拟环境,真实世界的迁移尚待验证。
Q&A
AgentGarten是什么?它主要用来做什么?
AgentGarten是MirroS团队发布的一个智能体训练平台,它将可执行的代码环境与实时神经渲染器连接起来,让智能体在可交互的物理世界中反复试错、积累经验,实现自我进化。
AgentGarten如何结合代码环境和神经渲染器?
AgentGarten让代码环境负责物理规则和状态更新,神经渲染器负责生成逼真的视觉画面。智能体发出动作后,代码环境计算物理碰撞并导出几何草图(如深度或法线),神经渲染器据此实时渲染出下一帧画面,形成闭环交互。
在捉迷藏实验中,AgentGarten的智能体学习速度有多快?
躲藏者在第4轮就学会了搬动挡板搭建掩体,搜寻者在第10轮掌握了借坡道翻墙。相比传统强化学习需要数千万甚至上亿局,速度大幅提升。
智能体如何通过实验手册实现经验积累和迁移?
每轮结束后,智能体复盘尝试、记录发现和疑问,写成实验手册。下一轮带着这些经验继续探索,区分实况与猜测,并标注防坑指南。经受住考验的经验被沿用,失效的教训促使尝试新策略,从而实现跨任务迁移。
AgentGarten的神经渲染器需要克服哪些技术挑战?
需要克服三大挑战:跟得上突发动作、稳得住超长交互、跑得足够快。团队采用Adversarial Forcing训练、精确重放机制、引入真实视频对抗、定制Triton融合算子等,实现30+ fps的实时交互。
AgentGarten与传统的视频世界模型相比有什么优势?
传统视频世界模型物理信息隐式,无法提供可查询、可干预的明确状态;而AgentGarten将物理交给代码,光影交给神经模型,物理规则确定可控,且能快速程序化生成大量逼真环境,成本从美术密集型变为代码扩展型。