多目标住宅能源管理中从示范推断偏好

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

本文介绍了强化学习中的两个重要近似,以及直接偏好优化方法。作者提出了一种新的通用目标ΨPO,可以绕过这两个近似。通过将Ψ设置为Identity,作者还提出了一种有效的优化过程,证明其性能优于DPO。

➡️

继续阅读