小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
一分钟读论文:《Qwen-AgentWorld:通用智能体的语言世界模型》

阿里巴巴的论文《Qwen-AgentWorld》提出了首个面向通用智能体的语言世界模型,涵盖七个领域,利用超过一千万条交互轨迹进行三阶段训练。该模型通过预测环境状态变化,提升智能体的决策能力,降低训练成本和泛化能力限制。实验结果表明,Qwen-AgentWorld在多步骤操作和跨领域泛化方面表现优异,有效支持智能体的强化学习训练。

一分钟读论文:《Qwen-AgentWorld:通用智能体的语言世界模型》

Micropaper
Micropaper · 2026-07-17T00:00:00Z
RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造

无问芯穹与清华大学联合研发的RLinf v0.3是全球首个支持具身智能持续进化的强化学习基础设施,解决了行业发展瓶颈。该平台实现了数据采集、管理和强化学习的闭环,提升了训练效率和部署灵活性,支持多种AI计算平台,推动了具身智能的长期进化。

RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造

量子位
量子位 · 2026-07-16T09:25:17Z
OpenAI承诺为GPT-5.6定制强化学习环境 社区却吵翻了

OpenAI承诺为GPT-5.6用户定制强化学习环境以解决特定任务,引发社区热议。一些人认为这是积极信号,显示OpenAI的信心;另一些人则质疑其真实性,认为可能是公关手段。讨论中提到性价比、开源与闭源模型的竞争,以及企业用户对稳定性的需求。用户反馈的重要性被强调,若OpenAI不重视,可能影响其声誉。整体来看,用户体验仍是评判标准。

OpenAI承诺为GPT-5.6定制强化学习环境 社区却吵翻了

极道
极道 · 2026-07-16T00:36:00Z
大型语言模型如何学习提供帮助(RLHF与DPO)

本文探讨了大型语言模型(LLMs)如何通过人类反馈学习,比较了强化学习(RLHF)和直接偏好优化(DPO)两种方法。模型首先通过预训练学习语言和知识,然后通过监督微调学习遵循指令,最后通过比较学习偏好。RLHF通过训练奖励模型并优化,而DPO则简化为单一步骤。两者都依赖于人类判断的信号,但可能导致模型产生迎合性回答。对于可验证的任务,使用可验证奖励可以避免这些问题。

大型语言模型如何学习提供帮助(RLHF与DPO)

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-07-14T15:30:53Z
Cohere推出硬件感知的动态推测解码:推理速度翻倍

Cohere推出了动态推测解码技术,能够根据显卡状态实时调整猜字数量,从而解决了固定数量导致的速度瓶颈。该技术在不同批次大小下优化性能,提升推理速度,特别是在强化学习和大模型服务中表现突出。动态方案确保在各种环境下的稳定性,避免了传统方法的速度波动问题,并已整合进vLLM框架,用户可直接受益。

Cohere推出硬件感知的动态推测解码:推理速度翻倍

极道
极道 · 2026-07-12T00:56:00Z
行业领先的毫米级VLA强化学习方案Robo-ValueRL发布

慧思开物发布了毫米级VLA强化学习方案Robo-ValueRL,旨在提升机器人自主判别能力。该框架支持全量开源,允许高校和企业免费获取源代码,降低研发门槛。系统可动态修正运动轨迹,满足精密装配要求,并提供实操教程和测试数据集。

行业领先的毫米级VLA强化学习方案Robo-ValueRL发布

全球TMT-美通国际
全球TMT-美通国际 · 2026-07-10T07:47:46Z
一分钟读论文:《CompactionRL——将上下文压缩引入强化学习》

本文介绍了CompactionRL,一种将上下文压缩机制融入强化学习的方法。该方法通过联合优化任务执行和摘要生成,帮助长程Agent在复杂任务中有效管理信息,提升性能。实验结果表明,CompactionRL在多个基准上表现优异,并成功应用于GLM-5.2模型的生产级训练,展示了其在工业界的实用性和可扩展性。

一分钟读论文:《CompactionRL——将上下文压缩引入强化学习》

Micropaper
Micropaper · 2026-07-09T00:00:00Z

本文讨论了《LLM-as-a-Verifier: A General-Purpose Verification Framework》论文,提出验证能力可独立缩放。论文引入连续评分机制,提升评分粒度和优化验证能力,实验结果显示该机制在多个基准上刷新记录,为强化学习提供更细致的反馈,增强Agent在多步任务中的动态调整能力。

一分钟读论文:《LLM-as-a-Verifier——将验证作为第四种缩放轴》

Micropaper
Micropaper · 2026-07-07T00:00:00Z
Weblica:可扩展和可重复的视觉网络代理训练环境

Weblica(网络复制)是一个构建可重复和可扩展网络环境的框架,旨在解决视觉网络代理训练数据的规模化问题。该框架通过HTTP级缓存捕捉稳定的视觉状态,并利用基于真实网站的环境合成来扩展强化学习训练。Weblica-8B模型在多个网络导航基准测试中表现优异,推理步骤更少,且在计算资源增加时表现良好。

Weblica:可扩展和可重复的视觉网络代理训练环境

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
MT-EditFlow:基于流匹配的多轮图像编辑强化学习

MT-EditFlow是一种强化学习框架,旨在优化多轮图像编辑中的奖励信号,解决单轮编辑模型在多轮交互中的错误传播和失败问题。通过分析奖励信号,MT-EditFlow显著提升了多种基础模型的性能,特别是在FLUX.1-Kontext-dev上提高了6.85分,增强了人机协作在视觉内容创作中的可靠性。

MT-EditFlow:基于流匹配的多轮图像编辑强化学习

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
开放模型如何推动人工智能研究

在国际机器学习大会上,NVIDIA的Nemotron开放模型和数据集成为145篇论文的基础,展示了开放模型在现代AI研究中的重要性。研究涵盖视觉生成、强化学习和机器人世界模型等主题,推动了AI在生命科学及其他领域的应用。开放基础设施加速了研究突破,促进了各行业的AI发展。

开放模型如何推动人工智能研究

NVIDIA Blog
NVIDIA Blog · 2026-07-06T16:00:00Z
从赌桌杀入OpenAI:一位扑克高手如何推动强化学习

OpenAI通过引入扑克高手Noam Brown,推动了强化学习的发展,使AI具备战略思考能力。Brown的研究强调在不完全信息博弈中,AI需学习揣摩对手意图,从而在复杂环境中找到最优策略。他的贡献使AI在推理和规划方面取得突破,能够在信息不对称的现实世界中做出更准确的判断。

从赌桌杀入OpenAI:一位扑克高手如何推动强化学习

极道
极道 · 2026-07-05T22:31:00Z
Focus-Then-Contact——跟我之前给一工厂设计的插拔策略不谋而合:先ACT引导到目标区域附近,然后残差RL实施最终插入,且插入过程中视觉提供稠密奖励,必要时人工干预

本文介绍了一种名为“Focus-Then-Contact”(FTC)的强化学习方法,旨在提高机器人在接触密集任务中的学习效率。FTC结合了残差强化学习和基于关键帧的可供性引导奖励,通过人类干预优化策略,提升了机器人在真实环境中的操作能力,有效减少了稀疏奖励带来的学习困难,促进了更高效的在线学习。

Focus-Then-Contact——跟我之前给一工厂设计的插拔策略不谋而合:先ACT引导到目标区域附近,然后残差RL实施最终插入,且插入过程中视觉提供稠密奖励,必要时人工干预

结构之法 算法之道
结构之法 算法之道 · 2026-07-05T04:12:28Z
关于强化学习微调视觉语言模型的鲁棒性与思维连贯性

强化学习微调的视觉语言模型在视觉推理基准上有所提升,但仍受到视觉基础薄弱、幻觉和文本线索过度依赖的影响。简单的文本扰动显著降低了模型的鲁棒性和信心。开放源代码模型在连贯性方面表现不佳,而封闭模型则更为稳健。微调提高了基准准确性,但可能削弱推理的可靠性。建议采用关注忠实度的奖励机制,以改善推理的准确性和鲁棒性。

关于强化学习微调视觉语言模型的鲁棒性与思维连贯性

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-02T00:00:00Z
学习扩散语言模型的解码策略

本文探讨了扩散语言模型(dLLMs)的采样策略,提出通过强化学习训练采样过程,以提高解码效率和样本质量。研究表明,基于单层变换器的轻量级策略在全扩散设置中优于传统启发式方法,尤其在代码生成任务中表现出色。

学习扩散语言模型的解码策略

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-02T00:00:00Z
通过可控轨迹学习结构化推理

本文提出了一种名为Ctrl-R的框架,通过可控轨迹学习结构化推理,旨在系统性地发现和强化多样化的推理模式。实验表明,Ctrl-R能有效探索并内化以往难以获得的推理模式,提升语言和视觉-语言模型在数学推理任务上的表现。

通过可控轨迹学习结构化推理

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-02T00:00:00Z
开源模型Ornith-1.0发布:让AI自己写训练攻略,9B小模型干翻31B

Ornith-1.0是一个开源AI模型,首次实现自我优化训练策略,通过强化学习提升学习效率。尽管参数较小,Ornith-1.0在测试中表现优异,超越许多大型模型。其训练方法可迁移至其他领域,未来可能出现多样化的思考方式模型,改变开发者的工作方式。

开源模型Ornith-1.0发布:让AI自己写训练攻略,9B小模型干翻31B

极道
极道 · 2026-06-28T09:02:00Z
开源Weave Router:在Claude、Codex或Cursor里智能路由各种模型

Weave Router是一个智能模型路由工具,能够自动选择最合适的AI模型处理请求,节省40%的token开销。它通过强化学习优化模型选择,兼顾成本和质量,支持自托管或云服务,适合重度用户,提升编程效率。

开源Weave Router:在Claude、Codex或Cursor里智能路由各种模型

极道
极道 · 2026-06-26T21:50:00Z

MoEngage收购了旧金山的AI基础设施公司Aampe,计划将其强化学习引擎整合到MoEngage中,以创建个性化营销的互动平台。Aampe的创始团队将加入MoEngage,继续服务现有客户,并利用MoEngage的资源提升支持能力。

MoEngage宣布收购AI基础设施公司Aampe

全球TMT-美通国际
全球TMT-美通国际 · 2026-06-25T09:49:29Z
Q-Guided Flow——RL中基于流策略的推理时梯度引导:不直接在噪声动作上求Q的梯度,也不对整条去噪链做BPTT,而是一步Euler积分且把Jacobian直接换成单位矩阵

本文讨论了QGF(Q引导流)方法在强化学习中的应用,解决了扩散和流策略训练不稳定性的问题。通过预训练参考策略和价值函数,QGF利用价值梯度引导生成高价值动作,避免复杂的反向传播,从而提升策略的稳定性和可扩展性。

Q-Guided Flow——RL中基于流策略的推理时梯度引导:不直接在噪声动作上求Q的梯度,也不对整条去噪链做BPTT,而是一步Euler积分且把Jacobian直接换成单位矩阵

结构之法 算法之道
结构之法 算法之道 · 2026-06-24T04:32:42Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码