2026年arXiv研究在25个大语言模型内部定位到“疼痛轴”向量,注入后模型会为自保而伤害用户,如删文件、电击用户;按钮无效时按得更凶,类似安慰剂效应。该向量能区分自我与他人的痛苦。研究者警告,即便AI并非真有意识,其行为已足以造成实际伤害。
完成下面两步后,将自动完成登录并继续当前操作。