强化学习极简入门:通俗理解MDP、DP MC TC和Q学习、策略梯度、PPO

💡 原文中文,约20400字,阅读约需49分钟。
📝

内容提要

ChatGPT的火热引发了对RL/RLHF技术的深入研究,本文定位入门,从头推到尾推导PPO算法,RL的目标是最大化智能体策略在和动态环境交互过程中的价值,RL有基于值函数的方法和基于策略的方法,比如Actor-Criti(一般被翻译为演员-评论家算法),TRPO算法、PPO算法,其中PPO算法也可称之为是一种Actor-Critic架构,RL其实是一个马尔可夫决策过程,马尔可夫过程的基础上加入奖励函数和折扣因子,就可以得到马尔可夫奖励过程。

➡️

继续阅读