CaRL:使用简单奖励学习可扩展规划策略

📝

内容提要

本文研究了在自主驾驶中使用强化学习(RL)进行特权规划的问题,现有的基于规则的方法无法有效扩展。我们提出了一种新的奖励设计,主要优化单一的直观奖励项:路线完成。这种简单奖励的使用使得PPO在大规模数据集上表现出良好的扩展性和性能,显著超越了具有复杂奖励的其他RL方法。

➡️

继续阅读