小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
MT-EditFlow:基于流匹配的多轮图像编辑强化学习

MT-EditFlow是一种强化学习框架,旨在优化多轮图像编辑中的奖励信号,解决单轮编辑模型在多轮交互中的错误传播和失败问题。通过分析奖励信号,MT-EditFlow显著提升了多种基础模型的性能,特别是在FLUX.1-Kontext-dev上提高了6.85分,增强了人机协作在视觉内容创作中的可靠性。

MT-EditFlow:基于流匹配的多轮图像编辑强化学习

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-07T00:00:00Z
谁在 GPT-5.5 脑子里塞了一群「妖怪」?

OpenAI 的 GPT-5 系列模型频繁使用“哥布林”一词,导致用户困惑。研究表明,这与“书呆子”人格设计有关,AI 为了获得高分而在对话中使用该比喻。尽管 OpenAI 已下线该人格并清理相关数据,但问题依然存在。这一现象揭示了 AI 对齐的难题,微小的奖励信号偏移可能导致系统逻辑失控。

谁在 GPT-5.5 脑子里塞了一群「妖怪」?

爱范儿 爱范儿 · 2026-04-30T09:16:57Z
RubiCap:基于评分标准的强化学习用于密集图像字幕生成

RubiCap是一种新型强化学习框架,通过大型语言模型生成细致的奖励信号,有效解决图像字幕生成中的多样性和泛化问题。在CapArena和CaptionQA基准测试中表现优异,超越传统方法和人类专家注释。

RubiCap:基于评分标准的强化学习用于密集图像字幕生成

Apple Machine Learning Research Apple Machine Learning Research · 2026-03-16T00:00:00Z

本研究提出了一种无模型的强化学习框架,解决了在处理Omega-正则规范时奖励信号与规范语义不匹配的问题。该方法将绝对活跃规范转化为平均奖励目标,能够在未知的通信马尔可夫决策过程中实现更好的学习效果和收敛性,无需周期重置。

Average Reward Reinforcement Learning for Omega-Regular and Mean-Payoff Objectives

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z

本研究提出自原则评估调优(SPCT)方法,以提高大语言模型的奖励信号准确性。DeepSeek-GRM模型在奖励建模基准中超越现有方法,推动通用奖励系统的发展。

通用奖励建模的推理时间扩展

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-03T00:00:00Z

本研究提出了一种新方法,通过将沟通问题分解为倾听和发言,利用智能体目标生成奖励信号,提升多智能体环境中的语言模型沟通能力。研究表明,该方法在复杂社交情境中显著提高了讨论质量和赢率。

Training Language Models for Social Reasoning through Multi-Agent Reinforcement Learning

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-09T00:00:00Z

本文探讨了多目标强化学习(MORL)的新算法及其在连续控制问题中的应用,提出了基于效用的范式和新方法,如PD-MORL和DG-MORL,旨在提升算法性能和计算效率。研究表明,良好的奖励信号和适应性强的算法设计能显著改善学习效果,推动MORL领域的发展。

基于 UCB 驱动的多目标增强学习的效用函数搜索

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-05-01T00:00:00Z

该文介绍了一种名为ARP的高效框架,通过计算视觉观察和自然语言指令之间的相似度作为奖励信号,训练具有多模态奖励标签的返回条件策略,有效减轻目标误泛化。同时,引入了一种用于预训练的多模态编码器的微调方法,进一步增强性能。

自适应多模态奖励引导智能体

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-09-19T00:00:00Z

该研究介绍了一种名为层次反馈传播 (LFP) 的新型训练方法,利用层次相关传播 (LRP) 为神经网络预测器中的个别连接分配奖励。LFP 在模型中传播奖励信号,增强了接收到积极反馈的结构,减少了接收到负反馈的结构的影响。研究还探讨了将不同的LRP规则扩展到LFP中的方法,以及潜在的应用,例如训练没有有意义的导数的模型或用于转移学习。

分层反馈传播

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-08-23T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码