WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放

WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,具身Scaling全面释放

💡 原文中文,约16900字,阅读约需41分钟。
📝

内容提要

它石智航发布具身原生基座模型AWE 3.5,在WAIC展示多机器人线束装配等实战。该模型采用One Model架构,从预训练起融合视觉、语言、动作,实现世界模型内强化学习,基于百万小时数据训练。首席科学家丁文超称具身Scaling已释放,2027年或现分水岭,并强调灵巧手是未来关键。

🔎

延伸解读

One Model架构:从预训练到后训练的自闭环

AWE 3.5采用One Model架构,从预训练阶段就融合视觉、语言、动作,避免了VLA路线中动作模态后接入的先天裂缝。模型本身不变,通过改变输入输出组合,可切换为Base Policy或Action Condition World Model,形成强化学习闭环。这种设计使模型能自我模拟物理交互,如拉拉链的毫米级操作,无需真机试错,大幅提升训练效率。

百万小时数据:规模与效率并重

AWE 3.5基于超百万小时human-centric数据训练,量级与主流视频生成模型相当。但具身数据价值分布不均,重复数据对模型提升有限。它石智航正将重心从数据量转向数据质量,强调Data Efficiency。目前新任务仅需小时级数据采集即可跑通,验证了预训练能力的扎实,也凸显了数据筛选和Infra建设的重要性。

灵巧手:具身智能的下一个里程碑

丁文超认为,夹爪能解决约80%的问题,但剩余20%需依赖灵巧手。灵巧手增加约20个自由度,双手配合引入约42个自由度,可能催生新技术挑战和能力涌现。它石智航采用Top-Down路径,从人类动作和数据需求反向定义硬件设计。乐观预期12到18个月内可见明显产业趋势,灵巧手或成为检验公司综合实力的关键。

行业分水岭:多场景可靠落地成评判标准

丁文超预测,2027年上半年到年中将出现分水岭,评判标准从单场景任务转向多场景可靠落地。未来12个月内,机器人将进入更多大众可触达场景,评判将更直观:完成哪些任务、扩展新任务的速度和成本。这类似自动驾驶早期轨迹,从演示路线到开城速度,最终进入存量竞争。

Q&A

它石智航在WAIC 2026上展示了什么?

它石智航在WAIC 2026上展示了基于具身原生基座模型AWE 3.5的多机器人线束装配流水线,以及观众可交互的世界模型演示,机器人还能完成整理桌面、打包手机、插网线、零件分拣等多种任务。

AWE 3.5模型的核心架构是什么?

AWE 3.5采用One Model架构,从预训练阶段就融合视觉、语言、动作等多种模态,同一套架构既能输出动作也能预测未来,通过改变输入输出组合实现不同功能,如Base Policy和Action Condition World Model。

AWE 3.5如何实现世界模型内的强化学习?

AWE 3.5依托human-centric数据强化长时记忆和空间理解,能在数分钟内保持环境稳定,后训练可从连续过程中切出动作片段,在模型内部模拟物理交互,进行自我对弈和强化,无需手工搭建仿真环境。

它石智航的训练数据规模有多大?

AWE 3.5基于超百万小时human-centric数据训练,与主流视频生成模型和自动驾驶数据量级相当,但更注重数据质量和效率,通过数据筛选和Infra优化提升Data Efficiency。

丁文超对具身智能Scaling和行业分水岭有何判断?

丁文超认为具身Scaling已全面释放,2027年上半年到年中可能出现分水岭,评判标准将是能否以一定可靠率完成多场景任务,实现多场景可靠落地。

灵巧手在具身智能中扮演什么角色?

灵巧手被认为是未来关键,夹爪只能解决约80%的问题,剩余20%需要灵巧手。它石智航采用Top-Down思路自研灵巧手,乐观预期12到18个月内能看到明显产业趋势。

它石智航如何解决实时部署和推理算力约束?

丁文超认为大模型可以推得很快,感知和动作生成可以异步解耦,感知低频更新,动作高频输出,参数量大的模型经过工程优化也能极速推理。

它石智航对具身智能领域的Research有何看法?

丁文超认为传统学术研究机会收窄,前沿研究向产业侧转移,企业需要重新定义Research,解决数据采集、预训练Infra、后训练流程等系统性问题,研究与工程紧密咬合。

🏷️

标签

➡️

继续阅读