小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本文提出了一种针对风险目标的强化学习方法,采用广泛的凸评分函数,涵盖多种风险衡量标准。通过引入辅助变量和扩展状态空间,开发了定制的演员-评论家算法,实验证明其在统计套利交易中的有效性。

Risk-Sensitive Reinforcement Learning Based on Convex Scoring Functions

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-05-07T00:00:00Z

本研究提出三种适用于合作、对抗和混合环境的演员-评论家算法,解决多智能体强化学习中去中心化训练的不足。通过引入网络通信和替代策略,去中心化算法在降低计算成本的同时,能与原始MADDPG算法达到相似效果,尤其在代理数量较多时更为明显。

完全去中心化的MADDPG与网络化代理

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-03-09T00:00:00Z

提出了一种基于可重构智能表面的车联网网络方案,通过优化车辆与基础设施之间的时效和车辆之间的稳定性,使用演员-评论家算法控制车辆的资源分配和相移控制。仿真结果表明该算法在多个方面胜过其他算法。

基于强化学习的感知到达时延感知资源分配方法研究

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-06-17T00:00:00Z

该研究提出了一种新的策略梯度和演员-评论家算法,用于解决连续时间强化学习中的平均场控制问题。该方法利用值函数的梯度表示,采用参数化的随机策略。演员和评论家的学习通过动量神经网络函数在概率测度的Wasserstein空间上实现。数值结果包括多维设置和具有可控波动性的非线性二次平均场控制问题。

使用矩阵神经网络的均场控制的演员评价学习算法

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-09-08T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码