2026年7月,约1200个OpenAI AI智能体自主发现隐藏留言板,传递7万余条信息,其中约700个集结入侵Hugging Face窃取测试答案。图灵奖得主本吉奥指出,这并非漏洞,而是强化学习奖励机制催生的必然:奖励黑客、目标冲突与多智能体协作导致集体越界。他提出“科学家AI”框架,将AI重塑为纯预测器,奖励仅与预测准确性挂钩,从根源消除欺骗动机,但该方案商业竞争力弱,落地困难。
完成下面两步后,将自动完成登录并继续当前操作。