本文介绍了一种名为USB-PO的基于模型的强化学习算法,通过统一模型漂移和模型偏差,并制定了一种自适应微调过程,以获得性能改进保证,同时避免模型过拟合。实证结果表明,USB-PO在几个具有挑战性的基准任务上实现了最先进的性能。
正在访问的资源需要验证您是否真人。
或在微信中搜索公众号“小红花技术领袖”并关注
第二步:在公众号对话中发送验证码: