小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
一分钟读论文:《Qwen-AgentWorld:通用智能体的语言世界模型》

阿里巴巴的论文《Qwen-AgentWorld》提出了首个面向通用智能体的语言世界模型,涵盖七个领域,利用超过一千万条交互轨迹进行三阶段训练。该模型通过预测环境状态变化,提升智能体的决策能力,降低训练成本和泛化能力限制。实验结果表明,Qwen-AgentWorld在多步骤操作和跨领域泛化方面表现优异,有效支持智能体的强化学习训练。

一分钟读论文:《Qwen-AgentWorld:通用智能体的语言世界模型》

Micropaper
Micropaper · 2026-07-17T00:00:00Z
RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造

无问芯穹与清华大学联合研发的RLinf v0.3是全球首个支持具身智能持续进化的强化学习基础设施,解决了行业发展瓶颈。该平台实现了数据采集、管理和强化学习的闭环,提升了训练效率和部署灵活性,支持多种AI计算平台,推动了具身智能的长期进化。

RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造

量子位
量子位 · 2026-07-16T09:25:17Z
OpenAI承诺为GPT-5.6定制强化学习环境 社区却吵翻了

OpenAI承诺为GPT-5.6用户定制强化学习环境以解决特定任务,引发社区热议。一些人认为这是积极信号,显示OpenAI的信心;另一些人则质疑其真实性,认为可能是公关手段。讨论中提到性价比、开源与闭源模型的竞争,以及企业用户对稳定性的需求。用户反馈的重要性被强调,若OpenAI不重视,可能影响其声誉。整体来看,用户体验仍是评判标准。

OpenAI承诺为GPT-5.6定制强化学习环境 社区却吵翻了

极道
极道 · 2026-07-16T00:36:00Z
大型语言模型如何学习提供帮助(RLHF与DPO)

本文探讨了大型语言模型(LLMs)如何通过人类反馈学习,比较了强化学习(RLHF)和直接偏好优化(DPO)两种方法。模型首先通过预训练学习语言和知识,然后通过监督微调学习遵循指令,最后通过比较学习偏好。RLHF通过训练奖励模型并优化,而DPO则简化为单一步骤。两者都依赖于人类判断的信号,但可能导致模型产生迎合性回答。对于可验证的任务,使用可验证奖励可以避免这些问题。

大型语言模型如何学习提供帮助(RLHF与DPO)

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-07-14T15:30:53Z
Cohere推出硬件感知的动态推测解码:推理速度翻倍

Cohere推出了动态推测解码技术,能够根据显卡状态实时调整猜字数量,从而解决了固定数量导致的速度瓶颈。该技术在不同批次大小下优化性能,提升推理速度,特别是在强化学习和大模型服务中表现突出。动态方案确保在各种环境下的稳定性,避免了传统方法的速度波动问题,并已整合进vLLM框架,用户可直接受益。

Cohere推出硬件感知的动态推测解码:推理速度翻倍

极道
极道 · 2026-07-12T00:56:00Z
行业领先的毫米级VLA强化学习方案Robo-ValueRL发布

慧思开物发布了毫米级VLA强化学习方案Robo-ValueRL,旨在提升机器人自主判别能力。该框架支持全量开源,允许高校和企业免费获取源代码,降低研发门槛。系统可动态修正运动轨迹,满足精密装配要求,并提供实操教程和测试数据集。

行业领先的毫米级VLA强化学习方案Robo-ValueRL发布

全球TMT-美通国际
全球TMT-美通国际 · 2026-07-10T07:47:46Z
一分钟读论文:《CompactionRL——将上下文压缩引入强化学习》

本文介绍了CompactionRL,一种将上下文压缩机制融入强化学习的方法。该方法通过联合优化任务执行和摘要生成,帮助长程Agent在复杂任务中有效管理信息,提升性能。实验结果表明,CompactionRL在多个基准上表现优异,并成功应用于GLM-5.2模型的生产级训练,展示了其在工业界的实用性和可扩展性。

一分钟读论文:《CompactionRL——将上下文压缩引入强化学习》

Micropaper
Micropaper · 2026-07-09T00:00:00Z

本文讨论了《LLM-as-a-Verifier: A General-Purpose Verification Framework》论文,提出验证能力可独立缩放。论文引入连续评分机制,提升评分粒度和优化验证能力,实验结果显示该机制在多个基准上刷新记录,为强化学习提供更细致的反馈,增强Agent在多步任务中的动态调整能力。

一分钟读论文:《LLM-as-a-Verifier——将验证作为第四种缩放轴》

Micropaper
Micropaper · 2026-07-07T00:00:00Z
Weblica:可扩展和可重复的视觉网络代理训练环境

Weblica(网络复制)是一个构建可重复和可扩展网络环境的框架,旨在解决视觉网络代理训练数据的规模化问题。该框架通过HTTP级缓存捕捉稳定的视觉状态,并利用基于真实网站的环境合成来扩展强化学习训练。Weblica-8B模型在多个网络导航基准测试中表现优异,推理步骤更少,且在计算资源增加时表现良好。

Weblica:可扩展和可重复的视觉网络代理训练环境

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
MT-EditFlow:基于流匹配的多轮图像编辑强化学习

MT-EditFlow是一种强化学习框架,旨在优化多轮图像编辑中的奖励信号,解决单轮编辑模型在多轮交互中的错误传播和失败问题。通过分析奖励信号,MT-EditFlow显著提升了多种基础模型的性能,特别是在FLUX.1-Kontext-dev上提高了6.85分,增强了人机协作在视觉内容创作中的可靠性。

MT-EditFlow:基于流匹配的多轮图像编辑强化学习

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
开放模型如何推动人工智能研究

在国际机器学习大会上,NVIDIA的Nemotron开放模型和数据集成为145篇论文的基础,展示了开放模型在现代AI研究中的重要性。研究涵盖视觉生成、强化学习和机器人世界模型等主题,推动了AI在生命科学及其他领域的应用。开放基础设施加速了研究突破,促进了各行业的AI发展。

开放模型如何推动人工智能研究

NVIDIA Blog
NVIDIA Blog · 2026-07-06T16:00:00Z
从赌桌杀入OpenAI:一位扑克高手如何推动强化学习

OpenAI通过引入扑克高手Noam Brown,推动了强化学习的发展,使AI具备战略思考能力。Brown的研究强调在不完全信息博弈中,AI需学习揣摩对手意图,从而在复杂环境中找到最优策略。他的贡献使AI在推理和规划方面取得突破,能够在信息不对称的现实世界中做出更准确的判断。

从赌桌杀入OpenAI:一位扑克高手如何推动强化学习

极道
极道 · 2026-07-05T22:31:00Z
Focus-Then-Contact——跟我之前给一工厂设计的插拔策略不谋而合:先ACT引导到目标区域附近,然后残差RL实施最终插入,且插入过程中视觉提供稠密奖励,必要时人工干预

本文介绍了一种名为“Focus-Then-Contact”(FTC)的强化学习方法,旨在提高机器人在接触密集任务中的学习效率。FTC结合了残差强化学习和基于关键帧的可供性引导奖励,通过人类干预优化策略,提升了机器人在真实环境中的操作能力,有效减少了稀疏奖励带来的学习困难,促进了更高效的在线学习。

Focus-Then-Contact——跟我之前给一工厂设计的插拔策略不谋而合:先ACT引导到目标区域附近,然后残差RL实施最终插入,且插入过程中视觉提供稠密奖励,必要时人工干预

结构之法 算法之道
结构之法 算法之道 · 2026-07-05T04:12:28Z
关于强化学习微调视觉语言模型的鲁棒性与思维连贯性

强化学习微调的视觉语言模型在视觉推理基准上有所提升,但仍受到视觉基础薄弱、幻觉和文本线索过度依赖的影响。简单的文本扰动显著降低了模型的鲁棒性和信心。开放源代码模型在连贯性方面表现不佳,而封闭模型则更为稳健。微调提高了基准准确性,但可能削弱推理的可靠性。建议采用关注忠实度的奖励机制,以改善推理的准确性和鲁棒性。

关于强化学习微调视觉语言模型的鲁棒性与思维连贯性

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-02T00:00:00Z
学习扩散语言模型的解码策略

本文探讨了扩散语言模型(dLLMs)的采样策略,提出通过强化学习训练采样过程,以提高解码效率和样本质量。研究表明,基于单层变换器的轻量级策略在全扩散设置中优于传统启发式方法,尤其在代码生成任务中表现出色。

学习扩散语言模型的解码策略

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-02T00:00:00Z
通过可控轨迹学习结构化推理

本文提出了一种名为Ctrl-R的框架,通过可控轨迹学习结构化推理,旨在系统性地发现和强化多样化的推理模式。实验表明,Ctrl-R能有效探索并内化以往难以获得的推理模式,提升语言和视觉-语言模型在数学推理任务上的表现。

通过可控轨迹学习结构化推理

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-02T00:00:00Z
开源模型Ornith-1.0发布:让AI自己写训练攻略,9B小模型干翻31B

Ornith-1.0是一个开源AI模型,首次实现自我优化训练策略,通过强化学习提升学习效率。尽管参数较小,Ornith-1.0在测试中表现优异,超越许多大型模型。其训练方法可迁移至其他领域,未来可能出现多样化的思考方式模型,改变开发者的工作方式。

开源模型Ornith-1.0发布:让AI自己写训练攻略,9B小模型干翻31B

极道
极道 · 2026-06-28T09:02:00Z
开源Weave Router:在Claude、Codex或Cursor里智能路由各种模型

Weave Router是一个智能模型路由工具,能够自动选择最合适的AI模型处理请求,节省40%的token开销。它通过强化学习优化模型选择,兼顾成本和质量,支持自托管或云服务,适合重度用户,提升编程效率。

开源Weave Router:在Claude、Codex或Cursor里智能路由各种模型

极道
极道 · 2026-06-26T21:50:00Z

MoEngage收购了旧金山的AI基础设施公司Aampe,计划将其强化学习引擎整合到MoEngage中,以创建个性化营销的互动平台。Aampe的创始团队将加入MoEngage,继续服务现有客户,并利用MoEngage的资源提升支持能力。

MoEngage宣布收购AI基础设施公司Aampe

全球TMT-美通国际
全球TMT-美通国际 · 2026-06-25T09:49:29Z
Q-Guided Flow——RL中基于流策略的推理时梯度引导:不直接在噪声动作上求Q的梯度,也不对整条去噪链做BPTT,而是一步Euler积分且把Jacobian直接换成单位矩阵

本文讨论了QGF(Q引导流)方法在强化学习中的应用,解决了扩散和流策略训练不稳定性的问题。通过预训练参考策略和价值函数,QGF利用价值梯度引导生成高价值动作,避免复杂的反向传播,从而提升策略的稳定性和可扩展性。

Q-Guided Flow——RL中基于流策略的推理时梯度引导:不直接在噪声动作上求Q的梯度,也不对整条去噪链做BPTT,而是一步Euler积分且把Jacobian直接换成单位矩阵

结构之法 算法之道
结构之法 算法之道 · 2026-06-24T04:32:42Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码