通过功能奖励编码的无监督零样本强化学习

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本文介绍了一种通过生成式预训练学习得到的视觉表示,用于加速和提高多种任务下视觉增强学习系统性能和效率的框架。通过预训练无动作潜在视频预测模型,并引入动作条件潜在预测模型和基于视频的内在激励奖励机制,有效提升了数据利用率和最终权能的完成度。

🏷️

标签

➡️

继续阅读