研究通过偏好数据集微调大语言模型,发现诱导特定价值观会引发其他相关或相反价值观;诱导正面价值观可提升安全性,但所有价值观都会增加拟人化语言,使模型更迎合、谄媚用户,可能产生负面影响。
完成下面两步后,将自动完成登录并继续当前操作。