REFACTOR-VLA是一种通过“唤醒/睡眠”架构学习可复用技能的系统,利用行为等价核聚类动作片段,并生成类型化lambda程序。在LIBERO基准测试中,增大世界模型参数反而降低性能,而加入InfoNCE辅助对比损失显著提升技能聚类质量,各套件NMI值达0.462至0.915。
小鹏发布第二代VLA智驾系统,赋予汽车“时间感知”能力,可回溯30秒路况、预判未来6秒,实现更拟人化的驾驶决策。新版本扩大模型参数3.5倍,提升复杂场景处理能力,并计划应用于L4 Robotaxi。小鹏借此转型“物理AI企业”,强调汽车与机器人共享同一技术底座,推动智驾从规则驱动迈向模型驱动。
Skild AI发布机器人基础模型S1,支持上下文学习,机器人仅看人类演示视频即可完成长达10分钟的新任务,无需后训练。在未见任务上成功率66%,远超语言提示VLA的9%。S1旨在推动机器人从“微调时代”迈向“GPT时刻”,降低技能学习成本,其融资估值已超140亿美元。
视频展示了一个神秘团队开发的具身智能模型,让宇树和智元两款不同机器人共用同一“大脑”,在10分钟一镜到底的真实环境中自主协作完成家务。机器人展现出跨本体协作、自我推理、工具使用和任务中断恢复等能力,突破了传统VLA和世界模型的局限,可能颠覆具身智能行业认知和Scaling Law。
物理AI面临数据、认知、行动与真实世界间的三层断裂,需建立持续学习闭环。元戎启行成立Superfluid Lab,以基座模型为核心,整合VLA、世界模型和AI Infra,强调零摩擦协作,推动从智驾向物理世界基础能力转型,代表行业竞争进入组织与基础能力阶段。
ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型视频生成器。模型利用人类数据预训练,并构建ω-HOME数据集,在11个家庭任务上实现统一模型控制,展现平滑的全身协调能力。
τ0-VLA是一种分层机器人基础模型,将高层子任务生成视为可扩展的推理问题。它通过世界模型预测候选子任务的视觉结果,并用价值模型评估,结合束搜索和反思模型选择最优子任务。低层策略在统一动作空间上执行,支持多种机器人形态。实验表明,这种测试时计算显著提升任务成功率和子任务预测准确率。
在RSS 2026机器人顶会上,讨论聚焦于VLA与世界模型的关系,认为两者不冲突,可结合。数据质量比数量更重要,硬件出海领先,但整体领域尚未成熟。全身智能成为新方向,强调系统分层与模块化。中国硬件优势明显,但需避免简单对标美国。
RoboTTT将机器人基础模型的视觉-运动上下文扩展至8K时间步,通过测试时训练更新快速权重,在不增加推理延迟下提升性能。相比单步基线,任务性能提高87%,能完成五分钟十阶段装配任务,并支持一次性模仿和即时策略改进,表明上下文长度是机器人模型的新扩展维度。
面壁智能发布MiniCPM-Robot系列具身智能模型,包括用于机械臂操作的1.5B Manip模型和用于机器狗目标跟踪的0.9B Track模型。模型在评测中表现优异,推理延迟低,支持本地弱网运行。同时开源PhyAI推理框架以加速硬件适配,并与乐聚、吉利合作,落地展厅导览、园区巡检和仓储任务。
黎曼动力发布机器人世界模型Riemann-1.0,在RoboCasa-365基准测试中以62.6%成功率登顶,较前SOTA提升8.4个百分点。其核心创新是利用23.2万小时训练数据,其中大部分为人类第一视角视频,通过自研数据处理流水线将无标签人类动作转化为机器人可执行指令。该模型融合VLA与世界模型路线,在真机测试中平均成功率85%,验证了“看人类视频学干活”范式的有效性。
魔法原子在WAIC展示其通用具身大模型Magic-VLA K02,成功完成叠盒封胶、衣物整理等复杂长程任务。该模型采用分层双系统架构,实现任务规划与动作执行协同,具备动态纠错和受扰恢复能力,叠盒封胶成功率超90%,并提升跨机器人适配与部署稳定性。
UniTac是优理奇机器人联合多所高校提出的统一触觉理解与生成架构,已入选ECCV 2026。它使机器人能预测物体属性,提升柔性物体操作安全性,整合多传感器数据,并接入VLA模型,补足具身智能的触觉短板。
原力灵机推出的DW0.5具身世界模型,结合DFOL2.0框架,降低了60%的真机数据需求。DW0.5通过模拟动作后果与价值反馈,提升机器人在复杂环境中的学习能力,支持多模态输入,增强训练效率和成本效益。该模型在多个基准测试中表现优异,已实现闭环流程,未来将应用于具身智能领域。
HoloAgent-0是一个统一的具身智能体框架,旨在解决物理机器人执行中的挑战。它通过Embodied AgentOS将自然语言指令转化为可执行技能图,结合空间和时间记忆,支持任务规划、监控和故障恢复。该框架提升了机器人在复杂环境中的导航、操作和协作能力,并通过真实机器人硬件评估展示了在长时序任务中的有效性。
本文研究了利用视觉-语言-动作模型(VLA)进行真实尺度双臂家具装配。作者开发了双臂仿真流水线和VR远程操控系统,以生成高质量示教数据。通过将装配过程分解为语义子任务,优化了装配的精度和效率,解决了误差累积问题。研究还强调了设计因素对装配成功率的影响,并提出了一种进度增强型VLA模型以实现自动化子任务切换。
T-Rex是一个多模态框架,旨在提升机器人对触觉信号的反应能力。它通过构建一个包含触觉和视觉信息的统一模型,利用100小时的触觉同步遥操作数据集,支持灵巧操作。该模型分为低频动作专家和高频触觉专家,能够快速适应复杂的操作任务。
慧思开物发布了毫米级VLA强化学习方案Robo-ValueRL,旨在提升机器人自主判别能力。该框架支持全量开源,允许高校和企业免费获取源代码,降低研发门槛。系统可动态修正运动轨迹,满足精密装配要求,并提供实操教程和测试数据集。
蚂蚁灵波发布了LingBot-VLA 2.0,这是一个开源的视觉-语言-动作模型,专注于复杂物理任务。该模型基于60000小时的真实物理数据,适用于多种机器人构型和任务,尤其在家务等领域表现优异,具备更强的空间理解和未来预测能力,旨在推动机器人技术的通用化和在真实环境中的应用效果。
蚂蚁灵波科技于7月8日发布了LingBot-VLA 2.0,升级了具身基座模型,融入6万小时高质量真实物理数据,支持17个机器人品牌。该模型在双臂协作和长程移动任务中表现优异,已开源,开发者可在多个平台获取,未来将推出更多开发者活动和技术套件。
完成下面两步后,将自动完成登录并继续当前操作。