Eureka:通过编码大型语言模型实现与人类水平的奖励设计

💡 原文中文,约500字,阅读约需1分钟。
📝

内容提要

Eureka是一种由LLMs支持的奖励设计算法,利用GPT-4等最先进的LLMs进行奖励代码的进化优化,生成可用于强化学习的复杂技能获取奖励函数。Eureka在多个开源强化学习环境中表现优异,通用性强,可用于人类反馈进行无梯度的上下文学习。

🏷️

标签

➡️

继续阅读