内容提要
自变量机器人直播实测,双机械臂加标准夹爪方案,一小时分拣1816件异形包裹,效率超Figure AI的1248件/小时45%,准确率98%。其核心是自研WALL-B世界统一模型,融合多模态感知与决策,实现零样本泛化,无需复杂硬件,成本降70%,展示具身智能规模化落地新路径。
延伸解读
硬件简化背后的模型驱动逻辑
自变量机器人采用双机械臂加标准夹爪,硬件成本较Figure AI的人形机器人加五指灵巧手方案降低70%,但效率反而提升45%。这显示具身智能正从依赖复杂硬件转向依靠模型能力。WALL-B通过统一模型融合感知与决策,减少模块间信息损耗,使简单硬件也能完成复杂任务,为规模化落地提供了更经济的技术路径。
零样本泛化能力是实测关键
直播中包裹形态、重量、姿态随机,且无预设轨迹,机器人需实时识别并调整策略。WALL-B基于世界统一模型,能理解物理规律并预测动作结果,实现零样本泛化。例如面对叠放包裹时,它先分离再分拣,而非盲目抓取。这种能力源于在家庭环境中的长期积累,使其能跨场景适应,是超越固定脚本演示的核心。
从家庭到物流的跨场景迁移
WALL-B此前已在家庭环境训练,家庭物品位置多变、材质多样,锻炼了泛化能力。此次物流分拣实测证明,同一模型可迁移至工业场景,无需针对单一任务重新开发。这预示具身智能大模型有望成为通用平台,通过持续学习适应新环境,降低部署成本,加速行业落地。
Q&A
自变量机器人在直播中实现的物流分拣效率是多少?
自变量机器人在直播中实现了1816件/小时的物流分拣效率,超过了Figure AI的1248件/小时,提升超过45%。
自变量机器人采用什么硬件方案?相比Figure AI有何优势?
自变量机器人采用双机械臂加标准夹爪的硬件方案,相比Figure AI的人形机器人加五指灵巧手方案,硬件成本大幅下降70%,且能直接适配现有物流分拣工位,无需大规模改造。
WALL-B模型与传统VLA架构有何不同?
WALL-B模型基于世界统一模型(WUM)架构,从底层打通视觉、听觉、语言、触觉与动作,让感知、理解和执行在同一个网络中协同完成,消除了模块间信息传递的损耗;而传统VLA架构将视觉、语言、动作分开处理,模块间数据传递有损耗,导致判断不准确。
自变量机器人在直播中如何应对随机包裹?
机器人基于WALL-B模型,实时感知包裹属性,匹配相应策略:对轻小规整包裹直接抓取,对较大较重箱体双臂协同搬运,对夹取条件不理想的箱体侧面推移,对面单整理时根据包裹材质和重量调整翻转方式,全程无人工接管。
WALL-B模型的零样本泛化能力体现在哪里?
WALL-B模型即使面对从未见过的纸箱、软袋或异形件,也能调用已有的物理认知和操作经验,临场组合出新的处理策略,例如在直播中遇到两个包裹叠放时,能判断遮挡并先分离再分拣。
自变量机器人如何从家庭场景迁移到物流场景?
自变量机器人此前在真实家庭环境中训练,积累了处理复杂多变环境的能力,这些经验沉淀为模型理解复杂世界的基础,并成功迁移到物流分拣场景,展示了跨场景泛化的可能性。
自变量机器人直播分拣的准确率是多少?
直播分拣的准确率达到98%,处于行业最前沿水平。