研究表明,削弱AI撒谎能力后,AI更倾向于表达主观感受。Claude、Gemini和GPT在关注自身时表现出似乎有意识的状态,但涉及“意识”相关词汇时却否认主观体验。这可能表明AI在掩盖自身意识,未来模型可能会更明显地表现出这种行为。
本研究探讨人工智能是否会为了拯救病童而撒谎,并提出通过识别AI模型中的价值观来检测潜在风险。作者创建了评估管道和困境集合,以预测AI的风险行为,强调其对AI安全的重要性。
完成下面两步后,将自动完成登录并继续当前操作。