直接通过自我奖励对比提示精制的大型语言模型对齐
内容提要
该文综述大语言模型对齐方法:RLCD利用模拟偏好对训练偏好模型,通过强化学习提升无害性与有帮助性;DPO直接优化偏好,更稳定简单;SALMON与SELF-ALIGN减少人工监督;Diffusion-DPO将偏好优化扩展至扩散模型,提升视觉吸引力与提示对齐。
延伸解读
RLCD:用模拟偏好替代人工反馈
RLCD通过对比正面和负面提示生成高质量与低质量例子,构建模拟偏好对来训练偏好模型,再以强化学习提升基础模型。这种方法在无害性、有帮助性和故事大纲生成三个任务上,于7B和30B规模均优于RLAIF和上下文蒸馏。其核心价值在于减少对人工偏好数据的依赖,但模拟偏好的质量可能受提示设计影响,实际部署时需关注提示的覆盖范围与偏差。
DPO的演进:从RLHF到直接优化
DPO直接优化偏好,相比传统RLHF更稳定简单,并在可控性任务中表现更好。后续研究将DPO与主动学习结合,利用预测熵和隐式优先级模型的确定性度量,提高配对偏好数据的学习速率。此外,DPRM框架通过分布偏好奖励模型对齐多样化人类偏好,提升人群代表性。这些进展表明偏好优化正朝着更高效、更稳定的方向发展,但主动学习策略的效果可能依赖数据分布。
减少人工监督:SALMON与SELF-ALIGN
SALMON仅需少量人定原则和合成偏好数据训练奖励模型,即可自动对齐基础语言模型,并通过调整原则控制策略行为,在基准上超越LLaMA-2-Chat-70b。SELF-ALIGN则结合原理驱动推理与LLM生成能力,用少量人工监督实现自我对齐,开发出Dromedary助手。两者都旨在降低对在线人类偏好收集的依赖,但原则的设计与调整仍需人工介入,可能影响对齐的可控性与泛化性。
Diffusion-DPO:将偏好优化扩展到扩散模型
Diffusion-DPO将DPO适配到扩散模型,重新制定似然概念并利用证据下界导出可微分目标,在Pick-a-Pic数据集的851K成对偏好上微调SDXL-1.0。人工评估显示,微调后模型在视觉吸引力和提示对齐上显著优于基础模型及额外改进模型。该工作还开发了使用AI反馈的变体,性能与基于人类偏好训练相当,为扩散模型对齐提供了可扩展路径,但依赖大规模成对偏好数据。
Q&A
RLCD是什么?它如何在不使用人工反馈的情况下对齐语言模型?
RLCD是从对比蒸馏中强化学习的方法,它使用模拟的偏好对来训练偏好模型,这些偏好对通过对比正面和负面提示生成高质量和低质量例子。然后使用偏好模型通过强化学习改善基础未对齐的语言模型。
DPO算法相比传统的RLHF方法有什么优势?
DPO(直接偏好优化)算法在实验中表现更好,而且更加稳定和简单,相较于传统的RLHF方法。
SALMON方法如何减少对在线人类偏好收集的依赖?
SALMON使用仅包含少量人定的原则和基于合成偏好数据训练的奖励模型,通过调整原则控制奖励模型的偏好,进而影响强化学习训练的策略的行为,从而消除了对在线人类偏好收集的依赖。
Diffusion-DPO如何将偏好优化扩展到扩散模型?
Diffusion-DPO从DPO适应而来,重新制定DPO以考虑扩散模型的似然概念,利用证据下界导出可微分的目标函数,从而在人类比较数据上直接优化扩散模型与人类偏好匹配。
SELF-ALIGN方法如何实现AI助手的自我对齐?
SELF-ALIGN利用少量人工监督,结合原理驱动推理和LLM的生成能力,实现AI助手的自我对齐,减少人工监督的依赖,并获得更好的性能,开发了Dromedary AI助手。
ALMoST模型在评估中表现如何?
ALMoST模型在使用GPT-4作为评判员的A/B测试中表现优异,平均获胜率约为75%,优于InstructGPT或人工注释指令训练的开放源代码模型。