Navigation Using QPHIL: A Quantized Planner for Hierarchical Implicit Q-Learning

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本文提出了一种基于变换器的分层方法,旨在解决离线强化学习中的价值估计误差,简化低级策略训练,并显著提升复杂导航环境中的性能。

🏷️

标签

➡️

继续阅读