小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中以推理时建立记忆信息,从而将视觉-运动上下文扩展到 8K 个时间步

摘要:本文提出RoboTTT方法,通过将测试时训练(TTT)机制整合到机器人基础模型中,实现了8K时间步的长视觉-运动上下文建模。该方法采用快速权重机制,在训练和推理时动态更新模型参数,将历史信息压缩至权重空间,解决了长上下文建模的三大挑战。实验表明,RoboTTT-8K相比单步基线在复杂任务中性能提升87%,首次证明扩展上下文长度能稳定提升闭环性能(比1K上下文模型提升63%)。创新性地结...

RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中以推理时建立记忆信息,从而将视觉-运动上下文扩展到 8K 个时间步

结构之法 算法之道
结构之法 算法之道 · 2026-07-21T15:49:12Z
1.5B开源通用VLA模型,冲进具身智能第一梯队

面壁智能发布MiniCPM-Robot系列模型

1.5B开源通用VLA模型,冲进具身智能第一梯队

量子位
量子位 · 2026-07-20T03:36:20Z
魔法原子Magic-VLA K02攻克叠盒封胶长程任务,成功率超90%

WAIC现场叠箱封胶,解锁物理AI新技能

魔法原子Magic-VLA K02攻克叠盒封胶长程任务,成功率超90%

量子位
量子位 · 2026-07-19T02:36:39Z
让VLA更懂接触,优理奇UniTac让机器人拥有“触觉想象力”

入选ECCV 2026

让VLA更懂接触,优理奇UniTac让机器人拥有“触觉想象力”

量子位
量子位 · 2026-07-18T10:55:47Z
用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界

原力灵机推出的DW0.5具身世界模型,结合DFOL2.0框架,降低了60%的真机数据需求。DW0.5通过模拟动作后果与价值反馈,提升机器人在复杂环境中的学习能力,支持多模态输入,增强训练效率和成本效益。该模型在多个基准测试中表现优异,已实现闭环流程,未来将应用于具身智能领域。

用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界

量子位
量子位 · 2026-07-16T02:30:46Z
HoloAgent-0——具备三维空间记忆的统一具身Agent框架:Agent自主拆解、规划,且按需调用技能层中的导航、VLA操作、全身运控,以及记忆层中的空间与时间记忆

HoloAgent-0是一个统一的具身智能体框架,旨在解决物理机器人执行中的挑战。它通过Embodied AgentOS将自然语言指令转化为可执行技能图,结合空间和时间记忆,支持任务规划、监控和故障恢复。该框架提升了机器人在复杂环境中的导航、操作和协作能力,并通过真实机器人硬件评估展示了在长时序任务中的有效性。

HoloAgent-0——具备三维空间记忆的统一具身Agent框架:Agent自主拆解、规划,且按需调用技能层中的导航、VLA操作、全身运控,以及记忆层中的空间与时间记忆

结构之法 算法之道
结构之法 算法之道 · 2026-07-14T09:30:41Z
FurnitureVLA——利用VLA学习长时域双臂家具装配:将装配长时任务拆分为多个子步骤,且提出进度VLA,以预测每个子任务的进度信号,最终实现子任务之间的切换

本文研究了利用视觉-语言-动作模型(VLA)进行真实尺度双臂家具装配。作者开发了双臂仿真流水线和VR远程操控系统,以生成高质量示教数据。通过将装配过程分解为语义子任务,优化了装配的精度和效率,解决了误差累积问题。研究还强调了设计因素对装配成功率的影响,并提出了一种进度增强型VLA模型以实现自动化子任务切换。

FurnitureVLA——利用VLA学习长时域双臂家具装配:将装配长时任务拆分为多个子步骤,且提出进度VLA,以预测每个子任务的进度信号,最终实现子任务之间的切换

结构之法 算法之道
结构之法 算法之道 · 2026-07-13T13:12:45Z
T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务

T-Rex是一个多模态框架,旨在提升机器人对触觉信号的反应能力。它通过构建一个包含触觉和视觉信息的统一模型,利用100小时的触觉同步遥操作数据集,支持灵巧操作。该模型分为低频动作专家和高频触觉专家,能够快速适应复杂的操作任务。

T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务

结构之法 算法之道
结构之法 算法之道 · 2026-07-12T16:21:19Z
行业领先的毫米级VLA强化学习方案Robo-ValueRL发布

慧思开物发布了毫米级VLA强化学习方案Robo-ValueRL,旨在提升机器人自主判别能力。该框架支持全量开源,允许高校和企业免费获取源代码,降低研发门槛。系统可动态修正运动轨迹,满足精密装配要求,并提供实操教程和测试数据集。

行业领先的毫米级VLA强化学习方案Robo-ValueRL发布

全球TMT-美通国际
全球TMT-美通国际 · 2026-07-10T07:47:46Z
60000小时炼出新开源VLA!20多种机器人都能用

蚂蚁灵波发布了LingBot-VLA 2.0,这是一个开源的视觉-语言-动作模型,专注于复杂物理任务。该模型基于60000小时的真实物理数据,适用于多种机器人构型和任务,尤其在家务等领域表现优异,具备更强的空间理解和未来预测能力,旨在推动机器人技术的通用化和在真实环境中的应用效果。

60000小时炼出新开源VLA!20多种机器人都能用

量子位
量子位 · 2026-07-08T03:54:42Z
支持17家机器人厂商20多种构型,蚂蚁灵波LingBot-VLA 2.0正式开源

蚂蚁灵波科技于7月8日发布了LingBot-VLA 2.0,升级了具身基座模型,融入6万小时高质量真实物理数据,支持17个机器人品牌。该模型在双臂协作和长程移动任务中表现优异,已开源,开发者可在多个平台获取,未来将推出更多开发者活动和技术套件。

支持17家机器人厂商20多种构型,蚂蚁灵波LingBot-VLA 2.0正式开源

量子位
量子位 · 2026-07-08T03:04:08Z
征程赶超|WAIC 2026世界模型激辩:答案不在VLA或世界模型,而在?

2026年,世界模型被认为是实现AGI的关键技术,李飞飞将其分为渲染器、模拟器和规划器。WAIC 2026将探讨物理AI的技术路径,关注行业争议与实际成果。因果世界模型的研究将增强机器人对物理规律的理解,推动AI从数据拟合向物理智能转变,未来将促进AI在实体经济中的应用。

征程赶超|WAIC 2026世界模型激辩:答案不在VLA或世界模型,而在?

量子位
量子位 · 2026-07-06T01:54:37Z
OpenHLM——全身VLA下的行走-操作:sonic作为运控底层,π0.5作为VLA的初始化策略(且基于umi改造出可以做全身数采的HuMI)

长沙具身团队在全身VR摇操系统SONIC的复现中,成功实现了全身自主VLA的采训推全流程,完成了自主桌面收纳任务和箱子搬运实验。研究探讨了全身控制器与遥操作接口的设计,提出基于关节的全身遥操作优于传统方法,并通过实证研究验证了VLA在仿人机器人中的适配性和有效性。

OpenHLM——全身VLA下的行走-操作:sonic作为运控底层,π0.5作为VLA的初始化策略(且基于umi改造出可以做全身数采的HuMI)

结构之法 算法之道
结构之法 算法之道 · 2026-06-26T15:17:10Z
1小时真机RL微调成功率破95%!HIL-ResRL:即插即用的VLA“外挂”神器

在具身智能领域,视觉-语言-动作(VLA)模型面临模仿学习导致的误差累积问题。华为云的HIL-ResRL方法通过人机协同和残差策略,提高了机器人在真实环境中的任务成功率,实验成功率超过95%。该方法无需重训练,适用于多种工业任务,并通过触觉反馈显著提高精度,展示了快速部署的潜力。

1小时真机RL微调成功率破95%!HIL-ResRL:即插即用的VLA“外挂”神器

量子位
量子位 · 2026-06-24T10:38:38Z
1小时真机RL微调成功率破95%!HIL-ResRL:即插即用的VLA“外挂”神器

HIL-ResRL是一种即插即用的VLA工具,经过1小时微调后成功率超过95%。该技术在提升机器学习模型应用效率方面具有重要意义。

1小时真机RL微调成功率破95%!HIL-ResRL:即插即用的VLA“外挂”神器

mongona news
mongona news · 2026-06-24T10:38:38Z
Galaxea G0.5——升级“VLA自回归建模”范式:摒弃VLM上添加动作专家的模式,而是构建统一模型,用一套权重,在同一个自回归token序列中同时生成推理与动作(含VLA-0的详解)

星海图提出的G0.5模型将视觉语言模型与动作生成统一为单一自回归序列,通过共享权重实现推理与动作的耦合,提升机器人控制效率。该模型采用可学习的动作分词器和视觉记忆模块,优化动作生成过程,减少离散化负担,能够在零样本条件下分解任务,直接生成动作,增强对复杂场景的适应能力。

Galaxea G0.5——升级“VLA自回归建模”范式:摒弃VLM上添加动作专家的模式,而是构建统一模型,用一套权重,在同一个自回归token序列中同时生成推理与动作(含VLA-0的详解)

结构之法 算法之道
结构之法 算法之道 · 2026-06-04T10:18:09Z
“VLA和世界模型都不是终局,会有物理世界独有的模型” | 蚂蚁灵波沈宇军@AIGC2026

蚂蚁灵波科技首席科学家沈宇军在2026中国AIGC产业峰会上指出,AI 2.0将从数字世界转向物理世界,强调数据的重要性。他认为机器人行业面临数据短缺,未来需结合VLA和世界模型,推动具身智能的发展。灵波致力于成为机器人时代的“安卓系统”,通过标准化数据和智能化操作提升机器人应用。预计到2028年,具身智能将快速发展。

“VLA和世界模型都不是终局,会有物理世界独有的模型” | 蚂蚁灵波沈宇军@AIGC2026

量子位
量子位 · 2026-05-25T06:56:42Z
Realtime-VLA V2——如何让vla运行的更快:从让π0实时抓取下落的钢笔到让 VLA 运行得更快、更平滑且更精确

本文探讨了基于消费级GPU的实时视觉-语言模型(VLA)机器人控制技术。通过优化推理流程,推理延迟降低至27.3毫秒,抓取成功率达到100%。研究表明,VLA在机器人控制中可有效满足实时操作需求。

Realtime-VLA V2——如何让vla运行的更快:从让π0实时抓取下落的钢笔到让 VLA 运行得更快、更平滑且更精确

结构之法 算法之道
结构之法 算法之道 · 2026-05-20T06:41:47Z
机器人的终局:英伟达 Jim Fan 宣告 VLA 时代结束,WAM 登场

英伟达的Jim Fan宣布VLA(视觉-语言-动作)架构已过时,推出新范式WAM(世界动作模型),代表作DreamZero。WAM通过人类第一人称视频训练,提升机器人自主设计能力,预计2040年前实现机器人自我制造。新模型强调视觉和动作的重要性,告别遥操作数据,采用外骨骼装置采集数据。

机器人的终局:英伟达 Jim Fan 宣告 VLA 时代结束,WAM 登场

宝玉的分享
宝玉的分享 · 2026-05-10T00:00:00Z
VLA死了,遥操也死了!英伟达机器人一号位说的

在红杉AI Ascent 2026大会上,Jim Fan宣布VLA和遥操作已不再适用,未来将依赖世界动作模型(WAM)和人类传感器数据。新范式通过模拟物理世界状态和动作微调,结合强化学习,推动机器人技术进步。EgoScale和Dream Zero等新策略将提升机器人在各种任务中的灵活性和自主性,预示着机器人行业的重大变革。

VLA死了,遥操也死了!英伟达机器人一号位说的

量子位
量子位 · 2026-05-09T06:24:18Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码