内容提要
具身智能领域兴起In-Context Learning(ICL)趋势,机器人通过观看演示视频即可学习新任务,无需微调。Skild AI和Generalist AI等公司展示了相关成果,但面临视觉理解、多模态和长上下文记忆等挑战。国内创业公司可可矩阵致力于将ICL作为底层范式,通过条件表征和轻量动作生成提升机器人学习效率,并探索自我纠错能力。
延伸解读
具身ICL的兴起背景
文章指出,具身智能领域正兴起In-Context Learning(ICL)趋势,机器人通过观看演示视频即可学习新任务,无需微调。这一趋势源于大语言模型(如GPT-3)的成功经验,并受到Skild AI和Generalist AI等公司成果的推动。然而,具身ICL面临视觉理解、多模态融合和长上下文记忆等挑战,其发展仍处于早期阶段。
国内创业公司的技术路线
可可矩阵(COCO Matrix)是一家国内创业公司,致力于将ICL作为具身智能的底层范式。与Skild和Generalist不同,可可矩阵将后训练的ICL前置到预训练阶段,通过条件表征和轻量动作生成提升机器人学习效率。公司创始人高宇翔强调,其目标是让ICL成为颠覆模型训练范式的核心,而非仅仅是一个功能。
ICL的挑战与未来方向
文章指出,具身ICL面临三大技术难点:视觉理解、多模态融合和长上下文记忆。可可矩阵认为,Long Context的重点并非简单延长窗口,而是实现流式机制,让机器人持续筛选和压缩历史信息。此外,公司还探索自我纠错能力,认为失败轨迹也是ICL的一种上下文,有助于机器人通过试错最终完成任务。
Q&A
什么是具身智能领域的In-Context Learning(ICL)?
具身智能领域的ICL是指机器人通过观看任务演示视频或提供示例,在不进行微调或参数更新的情况下,学会执行新任务的能力。例如,Skild AI的S1模型和Generalist AI的GEN-1.5都展示了这种能力。
Skild AI的S1模型和Generalist AI的GEN-1.5在ICL方面有什么不同?
Skild AI的S1模型支持最长10分钟的任务演示,而Generalist AI的GEN-1.5的示范视频仅3-12秒,在30秒窗口内完成学习。但可可矩阵创始人高宇翔认为,不能单纯看时长,更重要的是信息密度。
具身ICL面临哪些技术挑战?
具身ICL面临三大核心技术难点:视觉理解(需要同时理解高层语义和精细空间信息)、多模态(触觉、听觉等模态数据量不足)、长上下文和记忆(需要压缩、筛选和保留历史信息)。
可可矩阵在具身ICL方面采用了什么独特的技术路线?
可可矩阵采用“条件表征”或“条件隐空间”的方法,根据任务条件和动作意图动态提取不同层级的信息,而不是固定的一帧一Embedding。他们还强调“强理解、轻生成”,通过条件表征提炼动作相关信息,使动作头可以更轻量。
可可矩阵的One-Shot能力目前达到什么水平?
对于简单任务如常规抓取,在临时改变目标后,One-Shot Adaptation的完成率可稳定在80%以上。复杂任务仍在训练中,尚未完整评测。
为什么可可矩阵要做Self-Correction?
因为人类学习新任务时也会失败,但会从失败中调整。可可矩阵希望机器人也能利用失败轨迹进行自我修正,这被视为ICL的一种形态,即上下文不仅来自示范,也来自机器人自身的失败经历。
可可矩阵创始人高宇翔认为未来衡量机器人智能的指标可能是什么?
高宇翔认为,如果机器人能持续试错和自我纠正,单纯的成功率意义有限,未来可能更关注“第一次成功平均耗时”,即机器人看完一次示范后需要多久才能第一次学会任务,这反映了教学成本和学习效率。