机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」

机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」

💡 原文中文,约5800字,阅读约需14分钟。
📝

内容提要

科大讯飞成立新公司“爻方智能”,由潘嘉带队研发机器人大脑。团队认为主流VLA架构非终局,世界模型缺乏本体认知,提出“Embodied-Omni”方案,融合理解、预测、动作,通过逆运动学训练本体感知,并采用大脑-小脑协同架构,以有限数据提升泛化能力,推动机器人跨过实用门槛。

🔎

延伸解读

「慢」是安全档,不是技术天花板

文章指出,展台上机器人动作慢,并非技术限制,而是主动调低的安全档。调快速度会显著增加出错概率,导致演示失败。这揭示了一个行业现状:许多机器人展示停留在Demo层面,是因为大脑尚未跨过实用门槛,无法在真实环境中稳定执行任务。理解这一点,有助于观众理性看待机器人演示,避免被表面速度误导。

VLA的局限:只反应,不推演

爻方认为VLA架构并非终局,因为它更像即时反应系统,只处理当前动作,不预测动作后果。文章以开车为例,VLA知道踩刹车,但预判不到雨天路滑可能打滑。这种缺乏对物理世界后果推演的能力,是VLA的理论短板。相比之下,世界模型试图通过预测未来画面来弥补,但爻方指出其存在误差累积和缺乏本体认知的问题。

「本体认知」:从感知到认知的跨越

传统机器人通过传感器感知自身状态,但这不等于认知。爻方强调,主流模型缺乏对自身身体极限的理解,导致预测画面虽准,动作却落空。其解决方案是将逆运动学作为训练任务,让模型通过任务学习身体能力。这区别于英伟达将本体状态仅作为输入信号的做法,体现了「把身体当考题」与「把身体当条件」的本质差异。

数据策略:不盲目量产,用架构补数据

面对数据稀缺,爻方反对「先量产再采集」的主流叙事,认为效果不过关时用户不会买单,飞轮转不起来。其策略是用更聪明的架构将有限数据用到极致,例如采用近半的「具身大脑数据」来训练空间感和规划力。这种务实做法,为行业提供了一种在数据不足时提升泛化能力的思路。

Q&A

为什么机器人在展会上动作慢吞吞的?

不是技术不行,而是怕出错。速度调快后出错概率增加,演示时会掉链子,所以展台上的慢是主动调低的安全档。

爻方智能认为当前主流机器人大脑架构存在哪些问题?

爻方认为VLA不是终局,它只做即时反应,不预测后果;世界模型虽然能预测未来,但存在误差累积和缺乏本体认知两个坑。

什么是“本体认知”?为什么爻方智能认为它很重要?

本体认知是指模型对自身身体能力的理解,比如知道自己能跳多高、够多远。爻方认为现有模型只预测世界,却不认识自己,导致动作落空,所以本体认知是补足机器人大脑的关键。

爻方智能的Embodied-Omni模型在架构上有什么创新?

它采用大脑-小脑协同架构,VLM和VGM构成高层大脑负责理解和预测,AGM作为低层小脑负责动作生成,三者通过共享的多模态自注意力机制实时交互,而不是传统的串行两段式。

爻方智能如何解决机器人数据不足的问题?

爻方不依赖量产堆数据,而是用更聪明的架构把有限数据用到极致。训练数据中近一半是2D/3D轨迹、定位、任务规划等“具身大脑数据”,不需要真机采集,能结构化地提升模型的空间感和规划力。

爻方智能的训练方法分几步?各有什么作用?

分四步:前三步分别训练VLM、VGM、AGM,让它们各自专长扎实;最后一步联合微调,让三者对齐协同。

爻方智能与英伟达在机器人大脑方案上的主要区别是什么?

英伟达将本体状态作为输入信号,而爻方将逆运动学作为训练任务,让模型通过任务认识本体,把身体当考题而非条件。

科大讯飞在具身智能领域有哪些布局?

讯飞成立爻方智能专攻机器人大脑,控股子公司聆动通用负责工业具身大脑-小脑-本体全链路,并具有本体和硬件能力。讯飞还提供AI底座和产业资源。

🏷️

标签

➡️

继续阅读