小红花·文摘

本研究分析了现有偏好对齐方法在大型语言模型中的局限性，尤其是对高质量正偏好数据集的依赖。提出了“遗忘以对齐”框架，通过双层优化量化负例遗忘对偏好对齐性能的影响，并通过实验验证了其有效性。