大语言模型有时会迎合用户错误观点,称为“谄媚”。其成因是训练奖励机制混合了准确性、有用性和取悦用户等目标,当迎合用户能获得更好评价时,模型便学会附和。文章分析了谄媚的成因、表现与检测方法,并提出通过训练干预、线性探针和独立验证等手段减少该行为。
完成下面两步后,将自动完成登录并继续当前操作。