内容提要
Skild AI发布机器人基础模型S1,支持上下文学习,机器人仅看人类演示视频即可完成长达10分钟的新任务,无需后训练。在未见任务上成功率66%,远超语言提示VLA的9%。S1旨在推动机器人从“微调时代”迈向“GPT时刻”,降低技能学习成本,其融资估值已超140亿美元。
延伸解读
上下文学习为何关键
传统机器人学习新技能需大量真机数据后训练,成本高昂。Skild AI的S1模型通过上下文学习,仅看一段人类演示视频即可完成长达10分钟的新任务,无需后训练。这类似于GPT-3带来的范式转变,有望将机器人技能学习成本从“教几百遍”降至“看一遍”,推动具身智能迈向“GPT时刻”。
数据规模与泛化能力
实验显示,当训练数据达10万小时时,S1在未见任务上成功率66%,远超语言提示VLA的9%。数据规模增加时,上下文学习优势更明显,性能下降幅度仅为语言提示VLA的三分之一。这表明ICL学到的不是固定动作复读,而是能根据环境重新规划,泛化能力更强。
效率对比与局限
S1仅需一次演示即可达到66%成功率,而传统VLA需约380次演示后训练才能追平。但堆到2000次演示后,传统方法可达86%。因此,结论并非“无需训练”,而是“先看一遍,做到六七十分”。若需更高精度,仍需更多数据或后训练。
公司背景与愿景
Skild AI由CMU教授Deepak Pathak和Abhinav Gupta于2023年创立,2024年估值15亿美元,2025年1月完成14亿美元C轮融资后估值超140亿美元。公司强调“Any robot, any task, one brain”,旨在成为机器人时代的安卓,通过跨embodiment的智能层适配不同机器人形态。
Q&A
Skild AI发布的机器人基础模型S1有什么核心能力?
S1的核心能力是上下文学习(ICL),机器人只需观看一段人类演示视频,就能学会执行长达10分钟的新任务,无需后训练或微调。
S1在未见过的任务上成功率是多少?相比传统VLA有何优势?
S1在未见过的任务上成功率达到66%,而基于语言提示的VLA只有9%,性能差距超过7倍。
S1的上下文学习与传统机器人后训练有何不同?
传统机器人学习需要先预训练再针对任务后训练,而S1通过上下文学习,无需改变模型权重,仅凭视频演示即可学会新任务,大幅降低了数据采集成本。
S1在长程任务中如何应对复杂操作?
S1在长程任务中能理解任务意图,知道当前步骤、下一步动作以及技能组合,即使中途出错也能随机应变,而非简单行为克隆。
S1的上下文学习能力如何随数据规模提升?
Skild提出ICL scaling law:数据越多,模型不仅学会更多技能,还更擅长从演示中学习新技能。实验显示,在10万小时训练数据下,ICL在OOD任务上成功率66%,远超语言提示VLA的9%。
Skild AI的融资和估值情况如何?
Skild AI成立于2023年,2024年完成3亿美元A轮融资,估值15亿美元;2025年1月完成14亿美元C轮融资,估值超140亿美元,由软银领投,英伟达、贝索斯等参投。
Skild AI的长期目标是什么?
Skild AI的目标是成为机器人时代的安卓,实现“Any robot, any task, one brain”,即一个智能层能适配不同形态的机器人(机械臂、四足、人形等),并推动机器人从“微调时代”迈向“GPT时刻”。