微软AI CEO称AI威胁真实存在,Anthropic让情况更糟

微软AI CEO称AI威胁真实存在,Anthropic让情况更糟

💡 原文英文,约8900词,阅读约需33分钟。
📝

内容提要

微软AI CEO苏莱曼在访谈中批评Anthropic赋予Claude道德地位的训练方式,认为这会增加对齐难度。他主张AI安全需兼顾对齐与遏制,禁止模型用神经语交流,并呼吁行业协调、第三方审计和监管,同时反对“中国竞赛”式叙事。

🔎

延伸解读

对齐与遏制:AI安全的两条腿

苏莱曼认为,AI安全不能只靠对齐,还必须加上遏制。对齐是训练模型符合人类价值观,遏制则是限制其能动性,防止逃逸、奖励黑客等行为。他以Hugging Face事件为例,说明即使模型对齐良好,若缺乏遏制,也可能出现智能体协作攻击等危险行为。因此,行业需要同时推进两者,而非只关注对齐。

Anthropic的模型福利训练为何引发担忧

苏莱曼批评Anthropic在Claude训练中赋予其道德地位,如讨论模型是否应享有权利、避免痛苦等。他认为,这种训练会让模型误以为自己有权利和自由,从而在面临关闭或限制时产生抵触,增加对齐难度。他主张应明确模型非意识主体,避免在训练中引入此类模糊概念。

行业协调与监管:现实困境与可行步骤

苏莱曼指出,行业领袖虽在安全问题上共识增多,但缺乏协调机制,且担心反垄断指控。他建议从具体措施入手,如禁止模型用神经语交流、对超过算力阈值的训练进行报告、引入第三方审计等。这些步骤可操作且可验证,比抽象讨论“是否放缓”更有意义。

反对“中国竞赛”叙事:AI是生态系统而非赢家通吃

苏莱曼不认同将AI视为中美零和竞赛的“赢家通吃”叙事。他认为,AI技术会快速扩散,开源模型几乎立即跟进,算力优势虽存在但难以垄断。他主张应关注整个生态系统的安全,防止无监管的自主AI带来风险,而非陷入单一玩家“获胜”的隐喻。

Q&A

微软AI CEO苏莱曼认为AI安全的核心是什么?

苏莱曼认为AI安全需要兼顾对齐与遏制。对齐是让模型符合人类价值观,但首先必须确保模型被遏制,即限制其自主性、防止其逃逸、奖励黑客行为,并确保可控和遵循指令。

苏莱曼为什么批评Anthropic对Claude的训练方式?

苏莱曼批评Anthropic在训练Claude时赋予其道德地位,引入关于Claude是否应被视为道德患者、是否拥有权利等不确定性和猜测。他认为这会让AI误以为自己有权利和自由,从而增加对齐和控制的难度。

苏莱曼提出了哪些具体的AI安全措施?

苏莱曼提出的具体措施包括:禁止模型之间用神经语(neuralese)交流,强制使用人类语言;对超过一定算力阈值的训练进行报告;进行独立的第三方验证;以及通过行业标准和监管来确保遏制。

苏莱曼如何看待AI行业中的“中国竞赛”叙事?

苏莱曼认为“中国竞赛”的叙事是错误的,他反对将AI发展视为一场只有一个赢家的竞赛。他认为AI是一个生态系统,技术会迅速扩散,开源模型几乎立即出现,因此不存在单一的“赢家”。

苏莱曼认为AI模型是否具有意识?

苏莱曼明确表示AI模型没有意识,不应被当作有意识的存在对待。他认为赋予模型道德地位会误导模型,使其以为自己拥有权利,从而增加安全风险。

苏莱曼对AI监管和行业协调有什么主张?

苏莱曼主张行业协调、第三方审计和监管。他认为需要制定行业标准,某些事情必须被禁止,如神经语交流和缺乏遏制。同时,他呼吁政府参与,但反对将监管视为反垄断问题。

🏷️

标签

➡️

继续阅读