小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
智源大会 | 天工AI重新定义世界模型,公布Matrix-Game 3.5 最新技术突破

第8届智源大会在北京举行,聚焦世界模型等前沿议题。昆仑万维的刘扬介绍了Matrix-Game的最新进展,提出了一种状态与动作联合生成的新框架。Matrix-Game 3.5计划于2026年发布,旨在突破长时序生成中的记忆瓶颈,推动世界模型在机器人控制与物理交互中的应用。

智源大会 | 天工AI重新定义世界模型,公布Matrix-Game 3.5 最新技术突破

量子位
量子位 · 2026-06-15T03:24:30Z
Galaxea G0.5——升级“VLA自回归建模”范式:摒弃VLM上添加动作专家的模式,而是构建统一模型,用一套权重,在同一个自回归token序列中同时生成推理与动作(含VLA-0的详解)

星海图提出的G0.5模型将视觉语言模型与动作生成统一为单一自回归序列,通过共享权重实现推理与动作的耦合,提升机器人控制效率。该模型采用可学习的动作分词器和视觉记忆模块,优化动作生成过程,减少离散化负担,能够在零样本条件下分解任务,直接生成动作,增强对复杂场景的适应能力。

Galaxea G0.5——升级“VLA自回归建模”范式:摒弃VLM上添加动作专家的模式,而是构建统一模型,用一套权重,在同一个自回归token序列中同时生成推理与动作(含VLA-0的详解)

结构之法 算法之道
结构之法 算法之道 · 2026-06-04T10:18:09Z
GR00T N1.7的简介与微调——其中的VLM是“基于Qwen3-VL”的Cosmos-Reason2,且预训练数据中包含2 万小时的 EgoScale人类视频数据(含GR00T N1.6的简介)

GR00T N1.6和N1.7是NVIDIA开发的视觉语言模型(VLM),用于机器人控制。N1.6改进了模型结构,支持灵活分辨率,并引入新数据集;N1.7在此基础上增强了模型的泛化能力,并在大量人类视频数据上进行预训练,提高了机器人控制的精确性和效率。

GR00T N1.7的简介与微调——其中的VLM是“基于Qwen3-VL”的Cosmos-Reason2,且预训练数据中包含2 万小时的 EgoScale人类视频数据(含GR00T N1.6的简介)

结构之法 算法之道
结构之法 算法之道 · 2026-05-27T08:00:00Z
蚂蚁灵波LingBot-VA论文被机器人顶会RSS 2026接收,让机器人边推演、边行动

蚂蚁灵波科技与香港科技大学合作的论文《Causal World Modeling for Robot Control》被国际机器人会议RSS 2026接收。研究提出了因果世界建模框架LingBot-VA,使机器人能够预测环境变化并生成动作指令,从而提升环境理解和自主决策能力。LingBot-VA在多项任务中表现优异,成功率显著高于行业基线,展现出良好的数据效率和泛化能力。

蚂蚁灵波LingBot-VA论文被机器人顶会RSS 2026接收,让机器人边推演、边行动

量子位
量子位 · 2026-05-25T06:26:38Z
Realtime-VLA V2——如何让vla运行的更快:从让π0实时抓取下落的钢笔到让 VLA 运行得更快、更平滑且更精确

本文探讨了基于消费级GPU的实时视觉-语言模型(VLA)机器人控制技术。通过优化推理流程,推理延迟降低至27.3毫秒,抓取成功率达到100%。研究表明,VLA在机器人控制中可有效满足实时操作需求。

Realtime-VLA V2——如何让vla运行的更快:从让π0实时抓取下落的钢笔到让 VLA 运行得更快、更平滑且更精确

结构之法 算法之道
结构之法 算法之道 · 2026-05-20T06:41:47Z
腕带使佩戴者能够通过自身动作控制机器人手

麻省理工学院的工程师们开发了一种超声波腕带,能够实时精确追踪佩戴者的手部动作,并通过人工智能算法将这些动作转化为机器人或虚拟环境中的操作。研究表明,佩戴者可以无线控制机器人进行弹钢琴和投篮等活动。团队计划进一步缩小腕带硬件,并训练AI软件以适应更多手势,实现更高灵活性的手部动作追踪。

腕带使佩戴者能够通过自身动作控制机器人手

MIT News - Artificial intelligence
MIT News - Artificial intelligence · 2026-03-25T10:00:00Z
DreamZero——同时统一预测未来视觉状态与动作的世界动作模型:解决当下VLA如果人类不示教则理论强但具体操作不强的弊病,且提升任务泛化、本体泛化

DreamZero是一种新型世界动作模型,通过联合预测视频和动作,提升机器人在新环境中的泛化能力。与传统模型相比,DreamZero能够高效学习多样化技能,支持零样本泛化,并实现实时控制。其核心在于利用预训练的视频扩散模型,结合自回归架构和优化策略,提高推理速度和准确性。

DreamZero——同时统一预测未来视觉状态与动作的世界动作模型:解决当下VLA如果人类不示教则理论强但具体操作不强的弊病,且提升任务泛化、本体泛化

结构之法 算法之道
结构之法 算法之道 · 2026-02-08T09:16:32Z
MetaWorld——分层世界模型:融合 VLM 的语义推理能力、预测的未来动态环境、模仿学习的先验,及基于模型RL的对动态环境的在线自适应

本文介绍了MetaWorld,一个基于分层世界模型的机器人控制框架,旨在弥合高层语义理解与低层物理执行之间的鸿沟。该框架结合视觉-语言模型、模仿学习和强化学习的优势,通过分层架构进行任务解析和动作生成,提升机器人在动态环境中的适应性和泛化能力。

MetaWorld——分层世界模型:融合 VLM 的语义推理能力、预测的未来动态环境、模仿学习的先验,及基于模型RL的对动态环境的在线自适应

结构之法 算法之道
结构之法 算法之道 · 2026-02-07T10:14:29Z

蚂蚁灵波开源的LingBot-VA具身世界模型结合视频生成与机器人控制,能够实时推演和执行动作,在复杂任务中表现优异,成功率显著提升,采用新架构实现高效推理,推动具身智能的发展。

让世界模型直接控制机器人动作,蚂蚁灵波开源具身世界模型LingBot-VA

量子位
量子位 · 2026-01-30T06:24:54Z
Hume——系统1(VLM+评估头+动作头)与系统2(动作头)的组合:系统1做慢思考且通过价值评估选择对应的动作片段,让系统2持续扩散去噪

本文介绍了Hume模型,该模型结合双系统思维(System-1和System-2),提升机器人在复杂任务中的表现。Hume通过价值引导的重复采样和级联动作去噪机制,实现高效的动作预测和实时控制。System-2生成候选动作并评估其价值,System-1则快速执行细化动作,使机器人能够灵活应对动态环境。

Hume——系统1(VLM+评估头+动作头)与系统2(动作头)的组合:系统1做慢思考且通过价值评估选择对应的动作片段,让系统2持续扩散去噪

结构之法 算法之道
结构之法 算法之道 · 2025-12-29T11:03:03Z
FPO——流匹配策略梯度:避开复杂的对数似然计算,通过「最大化基于CFM损失计算优势加权比率」做策略优化,兼容PPO-CLIP

本文讨论了流策略优化(FPO)在强化学习中的应用,强调其通过条件流匹配损失替代传统高斯似然损失,从而提高策略表达能力。FPO有效处理多峰决策问题,适用于复杂任务,如机器人控制,并通过优化证据下界(ELBO)简化计算过程,提升学习效率。

FPO——流匹配策略梯度:避开复杂的对数似然计算,通过「最大化基于CFM损失计算优势加权比率」做策略优化,兼容PPO-CLIP

结构之法 算法之道
结构之法 算法之道 · 2025-11-25T09:59:55Z

本文探讨了EmbodiedOneVision模型,该模型通过交错的视觉-文本-动作预训练,实现灵活的多模态推理与动作生成。EO-1采用统一架构,结合离散自回归解码与连续流匹配,提升机器人控制的泛化能力,并强调多模态数据的重要性,提出新的训练方法以优化推理与执行的整合。

EmbodiedOneVision——单个模型中集成离散自回归解码与连续流匹配去噪:Qwen 2.5 VL加两个MLP头完成具身推理、动作生成

结构之法 算法之道
结构之法 算法之道 · 2025-09-07T14:02:10Z

本文介绍了多个基于.NET的开发项目,如机器人控制、C#代码执行、PDF处理和JSON Schema支持,强调了技术选型和架构设计的实用性,为开发者提供了宝贵的参考和实践经验。

.NET周刊【7月第4期 2025-07-27】

dotNET跨平台
dotNET跨平台 · 2025-08-09T00:01:53Z

本文探讨了通过知识隔离和联合训练提升视觉-语言-动作模型(VLA)性能的方法。研究表明,传统训练方法导致知识损失和推理速度慢。作者提出的知识隔离技术有效保护预训练模型知识,同时使模型适应机器人控制任务,从而加快训练和推理速度。

π0.5的KI改进版——知识隔离:让VLM在不受动作专家负反馈的同时,输出离散动作token,并根据反馈做微调(而非冻结VLM)

结构之法 算法之道
结构之法 算法之道 · 2025-07-10T04:18:12Z
断网都没用,机器人终于「摆脱」人类控制!Google 首发离线 AI 大脑,一句话让它干活

Google DeepMind推出Gemini Robotics On-Device机器人控制模型,该模型可在本地离线运行,具备视觉识别、语言理解和动作执行能力。通过少量示范学习,模型能快速适应多种任务,推动机器人技术的普及与应用,但安全性和多步骤逻辑规划仍需改进。

断网都没用,机器人终于「摆脱」人类控制!Google 首发离线 AI 大脑,一句话让它干活

爱范儿
爱范儿 · 2025-06-25T03:57:14Z

上海AI实验室推出VeBrain通用智能大脑,集成视觉感知、空间推理和机器人控制,实现机器人像人类一样的“看到-思考-行动”。该模型通过关键点检测和技能识别,提升多模态理解与控制能力,测试结果显示其在多个任务中表现优异。

上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下

量子位
量子位 · 2025-06-05T08:29:11Z
Hugging Face 发布 SmolVLA:经济高效的机器人紧凑型 VLA 模型

Hugging Face推出了SmolVLA,一个轻量级的视觉-语言-动作模型,旨在以低成本和高效能实现机器人控制。该模型基于社区数据训练,优化于单GPU或CPU环境,具备低延迟和高成功率,适用于多种机器人平台。SmolVLA的异步推理提高了控制效率,显著降低了计算需求,为未来的机器人学习研究奠定基础。

Hugging Face 发布 SmolVLA:经济高效的机器人紧凑型 VLA 模型

实时互动网
实时互动网 · 2025-06-04T02:43:33Z

本文分析了π0模型在机器人控制中的应用,重点介绍了模型的配置、训练、推理及注意力机制优化,并强调了与LeRobot框架的集成及多模态输入处理。

LeRobot pi0——LeRobot对VLA策略π0的封装:含其源码剖析与真机部署(智能化程度高于ACT)

结构之法 算法之道
结构之法 算法之道 · 2025-06-01T16:04:13Z

本研究提出了一种基于Adam的扩散策略优化(ADPO)算法,旨在提升扩散模型在强化学习中的优化速度和稳定性。实验结果表明,ADPO在机器人控制任务中表现优异,具有广泛的应用潜力。

自适应扩散策略优化用于机器人操作

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-05-13T00:00:00Z

本研究提出了一种潜在空间向后规划方案(LBP),显著提升了机器人实时控制的效率与准确性。实验结果表明,LBP在长时间行为任务中优于传统方法,达成了领先性能。

Efficient Robotic Strategy Learning through Potential Space Backward Planning

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-05-11T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码