自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

💡 原文中文,约4100字,阅读约需10分钟。
📝

内容提要

清华AIR与域变换联合发布Zeva,首个实现上下文因果学习(ICCL)的具身模型。它无需更新权重,通过因果交互提取、双时标记忆和上下文策略注入,让冻结模型在部署中自进化。在基准任务中累计成功率从26%提升至73%,真实化学实验室任务成功率显著增长,并支持一次人类演示学会新操作,开启上下文空间扩展的新范式。

🔎

延伸解读

零梯度自进化:从26%到73%的跃升

Zeva的核心突破在于无需更新权重即可实现部署中的持续学习。在RoboCasa365基准上,累计成功率从Evolve 1的26%提升至Evolve 4的73%,且模型参数完全冻结。这一结果验证了通过上下文因果学习,模型能够从自身交互经验中提取物理因果知识,逐步逼近真实环境动态,为具身智能的部署提供了一种低成本、高效率的进化路径。

双时标记忆:短期连贯与长期积累

Zeva通过双时标因果记忆机制,将当前尝试内的交互轨迹(BIT)与跨尝试的持久记忆(PIM)分离。BIT确保执行连贯性,PIM则沉淀失败与成功经验,供后续检索。这种设计使模型在重复尝试中越用越强,例如真实化学实验室中,Pick Up Test Tube任务成功率从65%升至100%,体现了跨尝试自我进化的实际效果。

一次演示,即刻学会:one-shot人类演示增强

Zeva支持通过一次人类演示初始化持久记忆,无需微调即可复现关键操作。量化结果显示,人类warm-up在Place Beaker任务上带来最高20个百分点的提升,在Pour Water上带来15个百分点。这表明因果上下文能够有效迁移人类演示中的物理因果知识,显著降低新任务的适应成本,为快速部署提供了实用方案。

从参数空间到上下文空间:新的scaling范式

Zeva的深层意义在于将具身模型的scaling从参数空间延伸至上下文空间。传统方法依赖扩大数据、参数和算力,而Zeva通过不断增加可供模型消费的因果上下文,使每次交互都成为对物理环境的隐式系统辨识。这种范式让部署从“能力消耗”变为“能力积累”,为具身智能开辟了独立于参数规模的进化曲线。

Q&A

Zeva是什么?它由谁发布?

Zeva是清华AIR与域变换联合发布的首个实现上下文因果学习(ICCL)的具身模型。它能在不更新权重的情况下,从自己的交互经验中持续学习,提升任务成功率。

Zeva的核心创新是什么?

Zeva的核心创新是实现了In-Context Causal Learning(ICCL),即模型在部署过程中通过上下文推断环境因果结构,并将因果知识用于下一次动作生成,无需更新权重即可实现自进化。

Zeva如何在不更新权重的情况下实现自进化?

Zeva通过三个关键组件实现:Causal Transition Encoder提取动作引起的状态变化,Dual-timescale Causal Memory组织短期和长期记忆,In-Context Policy Injection将因果上下文注入冻结的动作生成模型,整个过程零梯度更新。

Zeva在基准测试中的表现如何?

在RoboCasa365-Atomic5上,Zeva平均成功率达76.8%;在部署后的自进化曲线中,累计成功率从Evolve 1的26%提升到Evolve 4的73%。

Zeva在真实化学实验室任务中的表现如何?

在真实化学实验室ChemLab-Evo中,三个原子任务的累计成功率均单调增长:Pick Up Test Tube从65%到100%,Place Beaker从25%到70%,Pour Water从30%到80%。

Zeva如何支持从一次人类演示中学习新操作?

Zeva支持one-shot human demonstration enhancement:一次人类演示初始化Persistent Interaction Memory(PIM)后,模型无需微调即可复现关键操作。量化结果显示,人类warm-up在Place Beaker上最高带来20个百分点的提升,在Pour Water上带来15个百分点的提升。

Zeva的深层意义是什么?

Zeva的深层意义在于将具身模型的scaling从“参数空间”延伸到“上下文空间”,通过不断增加因果上下文来提升模型能力,开辟了独立于参数规模的新的scaling路径。

🏷️

标签

➡️

继续阅读