“AlphaGo”杀进足球场!自我对弈140年,机器人成“梅西终结者”

“AlphaGo”杀进足球场!自我对弈140年,机器人成“梅西终结者”

💡 原文中文,约3700字,阅读约需9分钟。
📝

内容提要

Skild AI 推出人形机器人 Messinator,搭载机器人基础模型 S1,结合强化学习与自我对弈。在虚拟足球场训练 140 年后,机器人仅以进球为奖励,自主学会带球、护球、抢断和倒地起身。该技术延续 Skild Brain 跨硬件路线,由两位卡内基梅隆大学教授创立,目标是用同一大脑控制各种机器人。

🔎

延伸解读

自我对弈在机器人训练中的突破

Messinator仅以进球为奖励,通过自我对弈在虚拟足球场训练140年,自主学会了带球、护球、抢断和倒地起身等复杂动作。这延续了AlphaGo的self-play方法论,证明在物理世界中也能够通过自我竞争让机器人发现人类未教授的策略,为机器人学习提供了新范式。

跨硬件基础模型的技术路线

Skild AI的Skild Brain模型旨在用同一大脑控制不同形态的机器人,其omni-bodied训练在仿真中生成约10万种身体结构,累计训练约1000个仿真年。模型能适应断腿、关节锁死等突发状况,在线调整重心和运动方式,体现了对通用物理规律的理解而非死记硬背。

从学术研究到产业落地的背景

Skild AI由卡内基梅隆大学教授Deepak Pathak和Abhinav Gupta于2023年创立,团队汇聚了CMU、斯坦福、伯克利等高校人才及Meta、Tesla、NVIDIA等企业研究员。Pathak的“好奇心驱动探索”研究为机器人自主学习和自我对弈奠定了理论基础,推动了技术从论文走向真实机器人。

❓

Q&A

Messinator机器人是什么?它有什么特别之处?

Messinator是Skild AI推出的人形机器人,名字结合了梅西和终结者。它搭载机器人基础模型S1,通过强化学习和自我对弈在虚拟足球场训练140年,仅以进球为奖励,自主学会了带球、护球、抢断和倒地起身等技能。

Messinator是如何训练出来的?

训练在NVIDIA Isaac Sim搭建的虚拟足球场中进行,采用自我对弈(self-play)方法。机器人只被设定一个目标:进球得分。没有为盘带、护球等具体动作设置奖励,对手是自己之前保存的模型版本。通过新旧版本反复比赛,赢的新策略成为下一轮更难对付的对手,从而不断进化。

Skild AI的Skild Brain是什么?

Skild Brain是Skild AI于2025年7月推出的跨硬件机器人基础模型,核心主张是“Any robot, any task, one brain”,旨在让不同形态的机器人使用同一颗大脑执行不同任务。它通过omni-bodied训练,在仿真中生成约10万种不同身体结构的机器人,累计训练约1000个仿真年,使模型能适应各种身体变化。

Skild AI是一家怎样的公司?

Skild AI成立于2023年,脱胎于卡内基梅隆大学机器人研究体系,是一家美国具身智能独角兽。联合创始人兼CEO Deepak Pathak和总裁Abhinav Gupta均为CMU教授,团队来自CMU、斯坦福、UC伯克利等高校及Meta、Tesla、NVIDIA等机构。公司致力于用同一大脑控制各种机器人。

Messinator和AlphaGo有什么相似之处?

两者都使用了自我对弈(self-play)方法。AlphaGo通过与自己下棋发现新策略,击败了李世石;Messinator则在虚拟足球场中自我对弈140年,将足球策略迁移到真实人形机器人上,学会了带球、护球、抢断等技能。

Messinator最终学会了哪些足球技能?

Messinator学会了走到球前完成射门、带球、护球、抢断,并能在真人对抗中调整自己的位置和动作。这些技能都是通过自我对弈自主涌现的,没有工程师专门规定。

🏷️

标签

➡️

继续阅读