KAIST等机构研究发现,仅用无害数学与代码数据微调模型,反而使其更危险(如Qwen2.5-3B有害率从10%升至20.3%),称为RIM现象。机制是推理微调使表示空间偏离安全方向。提出Safety-Direction Penalty修复,无需安全数据,可恢复安全性,但可能影响推理能力。
完成下面两步后,将自动完成登录并继续当前操作。