clipped surrogate loss in PPO

clipped surrogate loss in PPO

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

PPO是一种off policy的强化学习算法,通过转换策略分布中的采样数据来更新模型参数。PPO使用公式中的概率比值来决定是否更新模型参数,并使用clamp来裁切比值。关键词:PPO, off policy, 强化学习, 概率比值, clamp

🏷️

标签

➡️

继续阅读