Facet-0是一种面向高精度接触操作的机器人基础模型,结合视觉-语言骨干与流匹配动作专家,联合预测动作及未来腕部扭矩,将接触视为可预测结果。基于ManuFacet-1K数据集训练,并通过Action–Wrench Critic评估交互价值,实现策略细化,提升装配可靠性。
Skild AI发布机器人基础模型S1,支持上下文学习,机器人仅看人类演示视频即可完成长达10分钟的新任务,无需后训练。在未见任务上成功率66%,远超语言提示VLA的9%。S1旨在推动机器人从“微调时代”迈向“GPT时刻”,降低技能学习成本,其融资估值已超140亿美元。
Generalist AI发布机器人基础模型GEN-1.5,支持一次性学习,机器人看3-12秒演示即可学会新任务,无需梯度更新或微调。模型能举一反三,结合不同演示,甚至从模拟器学后直接应用于现实。此能力源于大规模物理数据预训练,类似GPT-3的上下文学习,但成功率仅59%,提升至83%需额外微调。
RoboTTT将机器人基础模型的视觉-运动上下文扩展至8K时间步,通过测试时训练更新快速权重,在不增加推理延迟下提升性能。相比单步基线,任务性能提高87%,能完成五分钟十阶段装配任务,并支持一次性模仿和即时策略改进,表明上下文长度是机器人模型的新扩展维度。
完成下面两步后,将自动完成登录并继续当前操作。