小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
ARM——用于长时序操作的优势奖励建模:采用三态标注策略(前进/后退/停滞),实现对相对优势的估计(含SARM详解)

研究者提出了优势奖励建模(ARM)框架,以解决长时间跨度机器人任务中的稀疏奖励问题。ARM通过三态标注策略(前进、后退、停滞)降低人类标注负担,并自动生成进度标注。在毛巾折叠任务中,该方法实现了99.4%的成功率,显著提高了强化学习的效率和稳定性。

ARM——用于长时序操作的优势奖励建模:采用三态标注策略(前进/后退/停滞),实现对相对优势的估计(含SARM详解)

结构之法 算法之道
结构之法 算法之道 · 2026-04-28T16:09:26Z
跨维智能DexWorldModel斩获榜首,世界模型真正的考场在机器人执行里

具身智能领域最近发布了GEN-1,成功率超过99%,速度提升2-3倍,微调成本降低至1/10。CEO Pete Florence强调,未来的世界模型应关注机器人任务的成功率,而非仅追求视觉质量。研究表明,高视觉质量与具身任务能力相关性较低,DexWorldModel通过改进表示、记忆、推理和数据引擎,提升了机器人在真实环境中的表现,展示了具身世界模型的潜力。

跨维智能DexWorldModel斩获榜首,世界模型真正的考场在机器人执行里

量子位
量子位 · 2026-04-21T00:06:39Z
GigaBrain-0.5M*(可对标π∗0.6)——从基于世界模型的RL中学习的VLA:通过“预测的价值和未来状态、经验数据、人工纠正”优化动作策略

本文介绍了GigaBrain-0.5M*模型,该模型通过世界模型增强了视觉-语言-动作(VLA)系统的能力。GigaBrain-0.5M*在GigaBrain-0.5的基础上,采用了基于世界模型的强化学习方法RAMP,显著提升了机器人在复杂任务中的表现,尤其在长时程任务中的前瞻性规划能力。

GigaBrain-0.5M*(可对标π∗0.6)——从基于世界模型的RL中学习的VLA:通过“预测的价值和未来状态、经验数据、人工纠正”优化动作策略

结构之法 算法之道
结构之法 算法之道 · 2026-02-16T04:11:48Z
Training-Time RTC——在训练时模拟推理延迟(承认既定事实专心预测后续动作):消除推理阶段的计算开销,让π0.6完成箱子装配与咖啡制作

自2023年大模型兴起以来,博客影响力迅速增长,吸引了国内外博士生的关注。PI公司提出的训练时实时分块(training-time RTC)方法,通过模拟推理延迟,显著降低计算成本并提升机器人任务执行性能。该方法无需修改模型架构,仅需少量代码实现,已在实际任务中验证有效性。

Training-Time RTC——在训练时模拟推理延迟(承认既定事实专心预测后续动作):消除推理阶段的计算开销,让π0.6完成箱子装配与咖啡制作

结构之法 算法之道
结构之法 算法之道 · 2025-12-13T14:52:40Z

Evo-0模型通过隐式注入3D几何先验,提升机器人对三维空间的理解,成功率提高31%。该方法无需额外传感器,利用VGGT提取3D信息,显著增强空间感知,训练效率高,适用于多种机器人任务。

机器人感知大升级!轻量化注入几何先验,成功率提升31%

量子位
量子位 · 2025-09-29T06:15:49Z

本文介绍了一种结合强化学习与视觉-语言-动作模型的微调方法ConRFT,旨在提升机器人任务的样本效率和安全性。ConRFT通过离线和在线两个阶段,利用人类示范数据和一致性策略,解决了传统方法在真实环境中的挑战,增强了智能机械臂的精准性和泛化能力。

ConRFT——Consistency Policy下RL微调VLA的方法:离线通过演示数据微调(结合Q损失和BC损失),后在线RL微调,且引入人工干预

结构之法 算法之道
结构之法 算法之道 · 2025-09-09T16:32:23Z

本研究提出了一种基于蒙特卡洛概率推理的学习控制方法(MC-PILCO),旨在提升复杂机器人任务的控制效率。研究表明,MC-PILCO在物理系统中优于传统方法,有效解决了控制欠驱动系统的问题。

Model-Based Reinforcement Learning for Global Control in Underactuated Systems

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-04-09T00:00:00Z
通过方向修正解释和改进最优控制问题

本文提出了一种基于方向修正的框架,以解决机器人任务中的最优控制问题(OCP)设计挑战。该方法通过分析不理想解的成本组件与专家修正方向的一致性,优化OCP目标函数,提高解决方案的可行性。

通过方向修正解释和改进最优控制问题

Apple Machine Learning Research
Apple Machine Learning Research · 2025-04-03T00:00:00Z

本研究提出SAFER框架,旨在解决大语言模型在机器人任务规划中的安全性问题。通过引入安全代理和LLM评判者,实时评估风险并主动修正错误,从而显著降低安全违规,同时保持任务效率。

Application of Safe Task Planning Based on Large Language Models in Robotics

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-03-19T00:00:00Z

本研究提出了一种新方法,通过自监督强化学习提高非线性系统中李雅普诺夫函数的推导效率,结果表明其在机器人任务中收敛速度更快、近似精度更高。

Neural Lyapunov Function Approximation Based on Self-Supervised Reinforcement Learning

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-03-19T00:00:00Z

本研究提出了一种新颖的离线算法,利用范德瓦尔斯力和功能奖励编码,显著提高机器人任务中的学习效率和稳定性,同时增强了多样性和处理非平稳奖励的能力。

双重力量:在模仿约束下增强离线多样性最大化

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-01-08T00:00:00Z

本研究提出了一种基于大型语言模型的用户代理,旨在降低收集多样化人机对话数据集的成本和劳动强度。该代理能够在虚拟环境中模拟用户行为,从而提高数据集生成的效率和可扩展性,增强机器人完成任务的能力。

Simulating User Agents for Embodied Conversational AI

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-10-31T00:00:00Z

本文研究了在机器人任务中通过自主互动学习和半监督学习动态生成奖励函数的方法。提出的中继策略学习和Optimal Transport Reward算法显著提升了机器人在复杂任务中的表现,尤其是在厨房模拟和手术机器人领域,实验结果表明这些方法在学习稠密奖励和策略优化方面具有明显优势。

基于时间最优传输奖励的机器人策略学习

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-10-29T00:00:00Z

本文介绍了多个机器人任务与动作规划的基准测试,如ManiSkill2、FurnitureBench和COLOSSEUM,旨在评估不同算法在复杂环境中的表现。研究发现,现有算法在环境扰动下的成功率显著下降,强调了提高操作泛化能力的重要性。此外,RobotScript平台和Manipulate-Anything方法展示了基于大型语言模型的机器人操作策略生成的潜力。

M${}^{3}$Bench:移动操控在三维场景下的全身运动生成基准测试

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-10-09T00:00:00Z

本文探讨了通过可视化和自监督学习在视频中识别动作的深度时空表示。研究表明,交叉流融合能够有效学习时空特征,预训练视觉表示在控制任务中表现优异。提出的离线视觉表示学习方法在图像导航和目标导航任务上显著提升性能,并展示了物体感知表征学习在机器人任务中的应用潜力。

面向控制的视觉潜在表征聚类

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-10-07T00:00:00Z

本研究提出了一种新的离线强化学习框架,解决信息路径规划中的风险和成本问题。通过批约束强化学习从预先收集的数据中学习,减少外推误差。实验表明,该方法在性能和速度上优于现有方法,展示了其在机器人任务中的应用潜力。

离线RL基础的信息路径规划

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-09-25T00:00:00Z

本文介绍了RoboBrain知识引擎及其在机器人任务中的应用,涵盖自然语言处理和规划。研究了自动操作求解器、视觉与语言操作基准、RoboAgent和RoboTool等系统,提升了机器人自主控制和任务执行能力。同时探讨了人机协作与扩展现实在工业中的应用,强调数字生态系统的重要性及未来研究方向。

KiloBot:一种用于大规模部署感知引导工业机械手的编程语言

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-09-05T00:00:00Z

本文介绍了一种基于自监督回归学习的深度强化学习算法(SSRL),该算法无需策略梯度或价值估计,通过监督回归数据提升策略表现。同时探讨了目标条件强化学习的挑战,提出了Weighted GCSL和DGRL等新方法,以优化目标达成和探索效率。此外,研究了无监督框架在无标签数据中的应用,展示了其在模拟机器人任务中的优越性能。

加速目标条件强化学习算法及研究

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-08-20T00:00:00Z

本文介绍了TrMRL,一种基于元强化学习的代理,结合了Transformer架构和记忆机制,提升了高维控制环境中的表现。研究探讨了模仿学习和自监督学习在机器人任务中的应用,强调了transformers在强化学习中的潜力与局限性,并提出了跨机器人策略转移的新方法。

身体变换器:利用机器人实体进行策略学习

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-08-12T00:00:00Z

该研究探讨了大型语言模型(LLMs)和多模态 LLMs 在机器人任务中的应用,提出了结合自然语言和视觉感知的框架,以提升机器人任务规划的表现。研究表明,GPT-4V 在多种编码任务中表现优异,显示其在机器人教育和人机交互中的潜力。

用大型语言模型对机器人系统进行语音命令的解释和学习

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-07-31T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码