小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Calibrated Q-learning(简称Cal-QL)——为高效在线微调而对“离线RL预训练”做校准:让学到的Q值有上界(保持CQL已做到的不盲目乐观),更有底线(不盲目悲观)

Cal-QL(校准Q学习)是一种提高离线强化学习后在线微调效率的方法。它通过校准Q值,避免了传统方法中的“遗忘”现象,确保学习到的Q值不低于参考策略的价值,从而防止智能体在微调时误认为新动作更优,导致性能下降。该方法在离线预训练后,通过在线交互进行有效的策略微调,提升了样本效率和策略性能。

Calibrated Q-learning(简称Cal-QL)——为高效在线微调而对“离线RL预训练”做校准:让学到的Q值有上界(保持CQL已做到的不盲目乐观),更有底线(不盲目悲观)

结构之法 算法之道
结构之法 算法之道 · 2025-12-16T11:06:50Z
🚀 第2天的 #100天编码挑战 – 精通 TypeScript 中的二分查找

今天我深入研究了二分查找,学习了如何高效解决有序数组的下界和上界问题,重点在于理解递归和边界情况。接下来,我计划研究旋转有序数组的查找。

🚀 第2天的 #100天编码挑战 – 精通 TypeScript 中的二分查找

DEV Community
DEV Community · 2025-02-21T05:46:40Z

本文探讨了LoRA微调中性能、参数与数据复杂性之间的关系,提出了一种基于互信息上界的内部度量,能够更准确地捕捉新旧知识的依赖关系。实验结果表明,该方法在评估LoRA微调的缩放法则上优于传统方法。

基于互信息上界的LoRA缩放法则

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-01-06T00:00:00Z

该文章介绍了一种解决多智能体强化学习通信问题的方法,通过自我监督的方式使用自动编码器预训练通信策略,实现从智能体观察中学习潜在马尔可夫状态。该方法适应新任务,支持智能体扩展,并能检测异常事件。实证结果显示该方法在未知任务中优于特定任务的通信策略。

需求感知的定制化多智能体通信协议与上界训练

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-09-11T00:00:00Z

该研究提出了一种名为自适应广义Neyman分配(AGNA)策略的新方法,用于固定预算最佳臂识别。该策略在小间隙情况下具有较紧密的上界,并改进了现有策略。研究对固定预算最佳臂识别中的渐近最优策略的存在性问题做出了贡献。

自适应广义 Neyman 分配:局部渐近极小极优最佳臂识别

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-05-29T00:00:00Z

该研究提供了一个评估图神经网络泛化误差的理论框架,探索了图卷积神经网络和消息传递图神经网络两种类型。通过新方法导出上界,为网络在未知数据上的性能提供理论保证。

混合图上的消息传递网络的泛化界限

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-04-04T00:00:00Z

Adam是一种用于基于梯度的随机目标函数优化的算法,易于实现、计算效率高、占用内存少,适合在数据和/或参数方面比较大的问题。实证结果表明Adam在实践中效果良好,并且与其他随机优化方法相比具有优势。同时,还讨论了一种基于无穷范数的Adam变体AdaMax。该算法的理论收敛性质被分析,并提供了一个和在线凸优化框架下已知最好的收敛速率相当的遗憾界。

缩小 Adam 迭代复杂度上界与下界之间的差距

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-10-27T00:00:00Z

该研究提出了一种变分框架来学习深度神经网络的激活函数,以增加网络容量并控制输入输出关系的Lipschitz常数的上界。实施l1约束,获得了稀疏的非线性激活函数,并在标准ReLU网络及其变化上进行了实验验证。

ReLU-FNN 的局部利普希茨常数计算:精确性验证的上界计算

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-10-17T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码