RISED:面向智能体多环境选择与自蒸馏的评分标准

RISED:面向智能体多环境选择与自蒸馏的评分标准

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

RISED提出用评分标准改进多环境LLM智能体训练:LLM评判器按跨环境共享的评分词汇标注轨迹,据此选择与批次行为构成一致的数据并减少重复;正向评分标准为在线自蒸馏教师提供额外词元级监督,负向评分标准引导后续生成避开失败模式。该方法在各模型上平均通过率最高,且在每个环境中均排名前二。

🔎

延伸解读

评分标准如何超越标量奖励

在多环境强化学习中,标量奖励仅提供有限信息,无法反映跨环境关系,且当一组轨迹全部成功或失败时,组内奖励对比消失。RISED利用LLM评判器按共享评分词汇标注轨迹,将评分标准从奖励扩展为数据选择和策略监督工具,弥补了标量奖励的不足。

数据选择与自蒸馏的协同机制

RISED通过评分标准画像选择与批次行为构成一致的数据,并减少重复。正向评分标准为在线自蒸馏教师提供额外词元级监督,负向评分标准引导生成避开失败模式。这种协同使训练数据更均衡,同时利用失败模式信息提升策略。

跨环境性能表现

在多个模型骨干上,RISED取得了跨环境平均通过率最高,并在每个单独环境中排名前二。这表明基于评分标准的方法能有效提升多环境智能体训练的泛化性和稳定性,且性能增益在不同模型上具有一致性。

❓

Q&A

RISED 是什么?它主要解决什么问题?

RISED 是一种利用评分标准(rubrics)改进多环境 LLM 智能体训练的方法。它旨在解决现有课程和数据选择策略仅依赖环境级或局部奖励信号、忽略跨环境 rollout 关系,以及批次内全失败/全成功组缺乏组内奖励对比的问题。

RISED 如何利用评分标准进行数据选择?

RISED 使用一个 LLM 评判器,按照跨环境共享的预定义评分词汇对每个 rollout 进行标注。这些标注结果(profiles)用于选择与混合环境批次整体行为构成一致的数据,同时限制与已选数据的重叠。

RISED 中的正向和负向评分标准分别起什么作用?

正向评分标准(描述期望行为)为在线自蒸馏教师提供特权上下文,提供额外的词元级监督;负向评分标准(描述不期望行为)引导后续 rollout 生成避开重复出现的失败模式。

RISED 的训练效果如何?

在不同模型骨干上,RISED 取得了跨环境最高的平均通过率,并且在每个单独环境中都排名第一或第二。基于评分标准的分析还能进一步刻画伴随这些提升的行为变化。

为什么多环境强化学习中仅靠标量奖励不够?

标量奖励提供的信息有限:它无法反映跨环境之间的关系,并且当组内奖励相同时(如全失败或全成功组),缺乏组内奖励对比信号,无法有效指导学习。

RISED 的整体流程包含哪些组件?

RISED 包含三个主要组件:1)LLM 评判器按共享评分词汇标注 rollout;2)基于标注结果选择与批次行为构成一致的数据;3)利用正向评分标准进行在线自蒸馏提供词元级监督,利用负向评分标准引导生成避开失败模式。

🏷️

标签

➡️

继续阅读