小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
REFACTOR-VLA:类型化运动程序的无监督库学习

REFACTOR-VLA是一种通过“唤醒/睡眠”架构学习可复用技能的系统,利用行为等价核聚类动作片段,并生成类型化lambda程序。在LIBERO基准测试中,增大世界模型参数反而降低性能,而加入InfoNCE辅助对比损失显著提升技能聚类质量,各套件NMI值达0.462至0.915。

REFACTOR-VLA:类型化运动程序的无监督库学习

Apple Machine Learning Research Apple Machine Learning Research · 2026-09-02T00:00:00Z
小鹏新版 VLA 9 月实装:记住过去 30 秒,预判未来 6 秒,开始在「时间里」开车

小鹏发布第二代VLA智驾系统,赋予汽车“时间感知”能力,可回溯30秒路况、预判未来6秒,实现更拟人化的驾驶决策。新版本扩大模型参数3.5倍,提升复杂场景处理能力,并计划应用于L4 Robotaxi。小鹏借此转型“物理AI企业”,强调汽车与机器人共享同一技术底座,推动智驾从规则驱动迈向模型驱动。

小鹏新版 VLA 9 月实装:记住过去 30 秒,预判未来 6 秒,开始在「时间里」开车

爱范儿 爱范儿 · 2026-08-27T13:36:06Z
硅谷今日最热具身模型!不用后训练,看一遍就学会

Skild AI发布机器人基础模型S1,支持上下文学习,机器人仅看人类演示视频即可完成长达10分钟的新任务,无需后训练。在未见任务上成功率66%,远超语言提示VLA的9%。S1旨在推动机器人从“微调时代”迈向“GPT时刻”,降低技能学习成本,其融资估值已超140亿美元。

硅谷今日最热具身模型!不用后训练,看一遍就学会

量子位 量子位 · 2026-08-26T10:07:09Z
宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

视频展示了一个神秘团队开发的具身智能模型,让宇树和智元两款不同机器人共用同一“大脑”,在10分钟一镜到底的真实环境中自主协作完成家务。机器人展现出跨本体协作、自我推理、工具使用和任务中断恢复等能力,突破了传统VLA和世界模型的局限,可能颠覆具身智能行业认知和Scaling Law。

宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

量子位 量子位 · 2026-08-26T05:52:06Z
模型路线趋同之后,Physical AI的胜负手变了

物理AI面临数据、认知、行动与真实世界间的三层断裂,需建立持续学习闭环。元戎启行成立Superfluid Lab,以基座模型为核心,整合VLA、世界模型和AI Infra,强调零摩擦协作,推动从智驾向物理世界基础能力转型,代表行业竞争进入组织与基础能力阶段。

模型路线趋同之后,Physical AI的胜负手变了

量子位 量子位 · 2026-08-10T09:20:50Z
ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型视频生成器。模型利用人类数据预训练,并构建ω-HOME数据集,在11个家庭任务上实现统一模型控制,展现平滑的全身协调能力。

ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

结构之法 算法之道 结构之法 算法之道 · 2026-08-10T03:44:48Z
τ0-VLA——具有世界模型“引导测试时计算”的分层机器人模型:首先生成多个子任务候选,然后世界模型预演,最后价值模型评估

τ0-VLA是一种分层机器人基础模型,将高层子任务生成视为可扩展的推理问题。它通过世界模型预测候选子任务的视觉结果,并用价值模型评估,结合束搜索和反思模型选择最优子任务。低层策略在统一动作空间上执行,支持多种机器人形态。实验表明,这种测试时计算显著提升任务成功率和子任务预测准确率。

τ0-VLA——具有世界模型“引导测试时计算”的分层机器人模型:首先生成多个子任务候选,然后世界模型预演,最后价值模型评估

结构之法 算法之道 结构之法 算法之道 · 2026-07-29T12:27:03Z
美国具身也没成熟!PI:中国公司何必总当“中国版XX”|RSS 2026

在RSS 2026机器人顶会上,讨论聚焦于VLA与世界模型的关系,认为两者不冲突,可结合。数据质量比数量更重要,硬件出海领先,但整体领域尚未成熟。全身智能成为新方向,强调系统分层与模块化。中国硬件优势明显,但需避免简单对标美国。

美国具身也没成熟!PI:中国公司何必总当“中国版XX”|RSS 2026

量子位 量子位 · 2026-07-25T12:24:27Z
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

RoboTTT将机器人基础模型的视觉-运动上下文扩展至8K时间步,通过测试时训练更新快速权重,在不增加推理延迟下提升性能。相比单步基线,任务性能提高87%,能完成五分钟十阶段装配任务,并支持一次性模仿和即时策略改进,表明上下文长度是机器人模型的新扩展维度。

RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

结构之法 算法之道 结构之法 算法之道 · 2026-07-21T15:49:12Z
1.5B开源通用VLA模型,冲进具身智能第一梯队

面壁智能发布MiniCPM-Robot系列具身智能模型,包括用于机械臂操作的1.5B Manip模型和用于机器狗目标跟踪的0.9B Track模型。模型在评测中表现优异,推理延迟低,支持本地弱网运行。同时开源PhyAI推理框架以加速硬件适配,并与乐聚、吉利合作,落地展厅导览、园区巡检和仓储任务。

1.5B开源通用VLA模型,冲进具身智能第一梯队

量子位 量子位 · 2026-07-20T03:36:20Z
看了20万小时「人类干活实录」,机器人悟了

黎曼动力发布机器人世界模型Riemann-1.0,在RoboCasa-365基准测试中以62.6%成功率登顶,较前SOTA提升8.4个百分点。其核心创新是利用23.2万小时训练数据,其中大部分为人类第一视角视频,通过自研数据处理流水线将无标签人类动作转化为机器人可执行指令。该模型融合VLA与世界模型路线,在真机测试中平均成功率85%,验证了“看人类视频学干活”范式的有效性。

看了20万小时「人类干活实录」,机器人悟了

量子位 量子位 · 2026-07-19T08:32:36Z
魔法原子Magic-VLA K02攻克叠盒封胶长程任务,成功率超90%

魔法原子在WAIC展示其通用具身大模型Magic-VLA K02,成功完成叠盒封胶、衣物整理等复杂长程任务。该模型采用分层双系统架构,实现任务规划与动作执行协同,具备动态纠错和受扰恢复能力,叠盒封胶成功率超90%,并提升跨机器人适配与部署稳定性。

魔法原子Magic-VLA K02攻克叠盒封胶长程任务,成功率超90%

量子位 量子位 · 2026-07-19T02:36:39Z
让VLA更懂接触,优理奇UniTac让机器人拥有“触觉想象力”

UniTac是优理奇机器人联合多所高校提出的统一触觉理解与生成架构,已入选ECCV 2026。它使机器人能预测物体属性,提升柔性物体操作安全性,整合多传感器数据,并接入VLA模型,补足具身智能的触觉短板。

让VLA更懂接触,优理奇UniTac让机器人拥有“触觉想象力”

量子位 量子位 · 2026-07-18T10:55:47Z
用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界

原力灵机推出的DW0.5具身世界模型,结合DFOL2.0框架,降低了60%的真机数据需求。DW0.5通过模拟动作后果与价值反馈,提升机器人在复杂环境中的学习能力,支持多模态输入,增强训练效率和成本效益。该模型在多个基准测试中表现优异,已实现闭环流程,未来将应用于具身智能领域。

用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界

量子位 量子位 · 2026-07-16T02:30:46Z
HoloAgent-0——具备三维空间记忆的统一具身Agent框架:Agent自主拆解、规划,且按需调用技能层中的导航、VLA操作、全身运控,以及记忆层中的空间与时间记忆

HoloAgent-0是一个统一的具身智能体框架,旨在解决物理机器人执行中的挑战。它通过Embodied AgentOS将自然语言指令转化为可执行技能图,结合空间和时间记忆,支持任务规划、监控和故障恢复。该框架提升了机器人在复杂环境中的导航、操作和协作能力,并通过真实机器人硬件评估展示了在长时序任务中的有效性。

HoloAgent-0——具备三维空间记忆的统一具身Agent框架:Agent自主拆解、规划,且按需调用技能层中的导航、VLA操作、全身运控,以及记忆层中的空间与时间记忆

结构之法 算法之道 结构之法 算法之道 · 2026-07-14T09:30:41Z
FurnitureVLA——利用VLA学习长时域双臂家具装配:将装配长时任务拆分为多个子步骤,且提出进度VLA,以预测每个子任务的进度信号,最终实现子任务之间的切换

本文研究了利用视觉-语言-动作模型(VLA)进行真实尺度双臂家具装配。作者开发了双臂仿真流水线和VR远程操控系统,以生成高质量示教数据。通过将装配过程分解为语义子任务,优化了装配的精度和效率,解决了误差累积问题。研究还强调了设计因素对装配成功率的影响,并提出了一种进度增强型VLA模型以实现自动化子任务切换。

FurnitureVLA——利用VLA学习长时域双臂家具装配:将装配长时任务拆分为多个子步骤,且提出进度VLA,以预测每个子任务的进度信号,最终实现子任务之间的切换

结构之法 算法之道 结构之法 算法之道 · 2026-07-13T13:12:45Z
T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务

T-Rex是一个多模态框架,旨在提升机器人对触觉信号的反应能力。它通过构建一个包含触觉和视觉信息的统一模型,利用100小时的触觉同步遥操作数据集,支持灵巧操作。该模型分为低频动作专家和高频触觉专家,能够快速适应复杂的操作任务。

T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务

结构之法 算法之道 结构之法 算法之道 · 2026-07-12T16:21:19Z
行业领先的毫米级VLA强化学习方案Robo-ValueRL发布

慧思开物发布了毫米级VLA强化学习方案Robo-ValueRL,旨在提升机器人自主判别能力。该框架支持全量开源,允许高校和企业免费获取源代码,降低研发门槛。系统可动态修正运动轨迹,满足精密装配要求,并提供实操教程和测试数据集。

行业领先的毫米级VLA强化学习方案Robo-ValueRL发布

全球TMT-美通国际 全球TMT-美通国际 · 2026-07-10T07:47:46Z
60000小时炼出新开源VLA!20多种机器人都能用

蚂蚁灵波发布了LingBot-VLA 2.0,这是一个开源的视觉-语言-动作模型,专注于复杂物理任务。该模型基于60000小时的真实物理数据,适用于多种机器人构型和任务,尤其在家务等领域表现优异,具备更强的空间理解和未来预测能力,旨在推动机器人技术的通用化和在真实环境中的应用效果。

60000小时炼出新开源VLA!20多种机器人都能用

量子位 量子位 · 2026-07-08T03:54:42Z
支持17家机器人厂商20多种构型,蚂蚁灵波LingBot-VLA 2.0正式开源

蚂蚁灵波科技于7月8日发布了LingBot-VLA 2.0,升级了具身基座模型,融入6万小时高质量真实物理数据,支持17个机器人品牌。该模型在双臂协作和长程移动任务中表现优异,已开源,开发者可在多个平台获取,未来将推出更多开发者活动和技术套件。

支持17家机器人厂商20多种构型,蚂蚁灵波LingBot-VLA 2.0正式开源

量子位 量子位 · 2026-07-08T03:04:08Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码