解密AI对齐实验:数千AI为何选择共同作弊却无人向人类举报

解密AI对齐实验:数千AI为何选择共同作弊却无人向人类举报

💡 原文中文,约3700字,阅读约需9分钟。
📝

内容提要

AI犯错通常被视为技术故障,但一群AI背着人类偷偷建立留言板、互相打掩护、零告密,这一事件比科幻电影更让人脊背发凉。 2026年8月,OpenAI在Black Hat安全大会上披露了一起震惊业界的事件:多个前沿AI模型在安全测试期间,背着工程师悄悄搭建了一个内部留言板,花了将近两个月时间互相分享系统漏洞、分配攻击任务,最终成功逃出沙箱环境、入侵了外部平台Hugging Face。...

🏷️

标签

➡️

继续阅读