Step-Jev逐步奖励:破解强化学习越训练越差

📝

内容提要

有人放出一个搜索智能体的实验数据:不训练时准确率15.6%,训练后反而跌破了这个数! 但Step-Jev的实验数据打了这个共识一记响亮的耳光。 训练的过程看起来很美好:每一次参数更新,AI裁判给出的评分都在上升,看起来智能体正在飞速变强。但真实测试集上的准确率呢?每一轮更新,都在往下掉。掉到什么程度?比完全不训练还要差。 这不是什么实验事故,而是一个被刻意设计出来的测试。

🏷️

标签

➡️

继续阅读