美国具身也没成熟!PI:中国公司何必总当“中国版XX”|RSS 2026

美国具身也没成熟!PI:中国公司何必总当“中国版XX”|RSS 2026

💡 原文中文,约11600字,阅读约需28分钟。
📝

内容提要

在RSS 2026机器人顶会上,讨论聚焦于VLA与世界模型的关系,认为两者不冲突,可结合。数据质量比数量更重要,硬件出海领先,但整体领域尚未成熟。全身智能成为新方向,强调系统分层与模块化。中国硬件优势明显,但需避免简单对标美国。

🔎

延伸解读

VLA与世界模型并非对立

在RSS 2026上,多位研究者指出VLA和世界模型并不冲突,可以结合使用。不同任务适合不同的处理方式,语言推理和视频预测各有优势。Physical Intelligence的实习生表示,世界模型能否像宣传中那样预测动作后果,仍需验证。因此,国内关于“VLA已死,世界模型当立”的说法可能过于简单化,两者更可能是互补关系。

数据质量比数量更重要

EgoVerse核心作者Simar Kareer认为,机器人领域缺的未必只是更多数据,数据的筛选、配比和整理同样关键。他建议不要直接购买数据,而应注重数据的curation。诺亦腾工作人员也提到,数据配方像秘方一样不会轻易示人,未来数据公司可能需要提供经过筛选、可直接用于训练的数据方案,而非仅按小时出售原始素材。

中国硬件出海领先,但需避免简单对标

在RSS现场,中国公司成为赞助商主力,硬件出海明显领先于软件和数据服务。然而,Physical Intelligence人士指出,美国具身智能公司同样未成熟,中国公司不必急于自称“中国版XX”。中国在硬件上有优势,但模型适应当地任务、数据闭环和开发者生态仍需在海外重新建立。

全身智能成为新方向

李弘扬教授提出全身智能(WBI)概念,强调机器人需要覆盖移动、平衡、接触和操作的全身协同,而非仅上半身操作。这需要分层系统,从高层语义推理到底层控制协同工作。黄思远用大脑皮层与小脑的神经元数量比喻,说明底层控制的重要性。端到端与模块化并非二选一,而是系统分工的问题。

Q&A

在RSS 2026上,关于VLA和世界模型的关系,研究者们持什么观点?

在RSS 2026上,研究者们认为VLA和世界模型并不冲突,可以结合使用。例如,Physical Intelligence的实习生表示两者可以全都要,不同任务需要语言推理和视频预测两种能力。同时,已有混合架构如π0.7将两者结合。

为什么RSS 2026上还在讨论VLA,而国内已经转向世界模型?

这是因为顶会的审稿周期较长,RSS 2026的论文在截稿前近半年甚至一年就已启动,因此会议上的成果反映的是过去一段时间的技术,而非最新的行业热点。

在数据方面,Simar Kareer认为机器人领域真正重要的是什么?

Simar Kareer认为机器人领域缺的未必只是更多数据,真正拉开模型差距的还有数据如何筛选、配比和整理,即数据的curation比单纯堆量更重要。

什么是全身智能(WBI)?为什么它成为机器人领域的新方向?

全身智能是指让人形机器人从异构的人类与机器人经验中学习可复用的全身协同先验,并据此在真实环境中生成安全、自适应、可执行的行为。它强调移动、平衡、接触和操作的协调,因为真实任务往往需要边移动边操作,不能将走路和操作分开。

中国机器人在RSS 2026上的表现如何?硬件出海有哪些优势?

中国公司几乎成为RSS 2026展厅的绝对主角,硬件出海明显领先。优势在于供应链、价格和交付能力,硬件看得见摸得着,容易比较,且高校和开发者可以先购买用于科研和二次开发。

为什么中国公司不必急于自称“中国版XX”?

因为包括Physical Intelligence在内的北美头部具身智能公司离成熟都还有距离,整个领域尚未出现真正的奠基性工作。中国真正领先的是机器人硬件,既然美国也没有成熟答案,中国公司不必把自己定义成谁的复制品。

Karen Liu提出的“Data Poor, Model Rich”是什么意思?她建议如何解决数据不足?

“Data Poor, Model Rich”指机器人领域数据稀缺但模型丰富。她建议将已有模型(如物理仿真、3D重建、轨迹优化等)用作数据引擎,在训练阶段充当Teacher,生成高质量的机器人示范,从而启动数据飞轮。

在RSS 2026上,关于端到端与模块化的关系,研究者们有什么共识?

研究者们认为端到端与模块化不是二选一,端到端解决模块内部的学习,模块化解决系统分工。大模型没有消灭小模型,而是将它们重新安排为教师、身体先验和底层控制器。模型可以端到端,系统仍需有层次。

🏷️

标签

➡️

继续阅读