SALSA:基于汤的对齐学习以增强RLHF中的适应性

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本文提出了一种新策略SALSA,通过对两个监督微调模型的权重空间进行平均,旨在克服传统RLHF方法的局限性,提升模型的鲁棒性和表现,超越传统的PPO方法。

🏷️

标签

➡️

继续阅读