本研究通过引入Rényi散度变分推断,扩展了风险敏感控制的推断方法(RCaI)。研究表明,风险敏感最优策略可通过软贝尔曼方程获得,揭示了RCaI与最大熵控制之间的等价性,为风险敏感强化学习提供了统一框架。
完成下面两步后,将自动完成登录并继续当前操作。