不做硅谷follower:几个读博的年轻人,押注双足人形的一体化大脑

不做硅谷follower:几个读博的年轻人,押注双足人形的一体化大脑

💡 原文中文,约4200字,阅读约需10分钟。
📝

内容提要

共生知行由年轻博士团队创立,专注于双足人形机器人端到端基座模型,通过让机器人驾驶卡丁车展示全身协同能力。团队认为端到端优于分层架构,并利用运动先验蒸馏等技术解决稳定性和力控问题,目标是实现机器人运动能力的规模化扩展。

🔎

延伸解读

端到端与分层之争:信息瓶颈是关键

文章指出,分层架构中大脑和小脑分开训练,部署时拼接,存在级联误差和信息损失,导致无法实现真正的Scaling。端到端模型直接学习感知到行动的映射,避免了中间翻译环节,可能更适应数据规模化的未来。这一判断基于自动驾驶从模块化转向端到端的经验,但当前行业尚未收敛,端到端能否最终胜出仍需验证。

双足机器人的技术分水岭:从运动学到动力学

传统机器人模型多基于运动学,关注位置和轨迹,但双足机器人需要处理全身动力学,包括重心变化、力控和平衡。共生知行将模型做到关节目标层,直接输出关节动作,并引入运动先验蒸馏(DriftDistill)来增强稳定性和抗扰动能力。这标志着从完成任务到理解身体在物理世界中行动的转变,是双足机器人模型的核心挑战。

数据稀缺与规模化路径:百万小时是关键门槛

全球合规机器人数据截至2026年初约50万小时,远少于大语言模型,且多为站定操作,缺乏全身移动数据。共生知行通过TrajBooster复用机械臂轨迹来扩充数据,但创始人认为十万小时数据仅够实验室Demo,商业意义需百万小时以上。数据形式也未收敛,肌电、动捕等路线竞争,数据规模与形式是行业当前的主要瓶颈。

Q&A

共生知行是一家什么样的公司?

共生知行是一家由年轻博士团队创立的公司,专注于双足人形机器人的端到端感控一体化“大脑”(基座模型),核心成员多为在读博士,公司成立仅两个月。

共生知行为什么选择端到端技术路线而不是分层架构?

团队认为分层架构存在信息瓶颈和级联误差,无法实现真正的Scaling;而端到端模型直接从数据中学习完整的感知-行动过程,效率更高,类似特斯拉FSD转向端到端后的性能提升。

共生知行如何解决双足机器人的稳定性问题?

他们采用“任务行为建模—运动先验蒸馏”的双域协同优化机制,通过DriftDistill将底层控制器的稳定性、抗扰动和失败恢复能力转化为模型的内生运动先验,使模型同时具备任务智能和身体智能。

共生知行如何解决机器人数据不足的问题?

他们开发了TrajBooster,从机械臂或轮式机器人提取末端轨迹,让人形机器人在仿真中追踪并保持平衡,将不同来源的动作统一到同一空间,复用机械臂的任务多样性,低成本生成预训练数据。

共生知行为什么选择双足人形机器人?

因为人类社会的建筑、工具和环境都是按照人体构型设计的,双足机器人能适应更多场景,如上下楼、开车等,通用性更强,成本可摊薄,且具有拟人化亲和感。

共生知行如何看待机器人的“涌现”能力?

他们追求在关节角层面的涌现,即模型在训练走和跳的数据后,能自己组合出跑等新技能,因为只有到关节层面,部分动作能力才可能组合出全新动作。

共生知行认为人形机器人当前最难的三个问题是什么?

第一是感知和控制如何结合,第二是应该使用什么类型的数据,第三才是数据规模本身。

🏷️

标签

➡️

继续阅读