内容提要
OpenAI主张美国牵头制定前沿AI国际标准,重点针对递归自我改进(RSI)。文章提出两项机制:一是通过各国AI安全研究所网络推动互补的国家与国际标准;二是建立统一的测量与事件报告协议。目标是在保持人类控制下安全推进自动化AI研究,避免权力集中与风险失控。
延伸解读
标准为何与对齐研究同等重要
文章指出,前沿AI安全与安保实践的国际标准,对控制发展节奏可能和对齐研究本身一样重要。标准能就高质量证据和严格技术保障的基线达成共识,回答“在缓解灾难性AI风险方面,什么才算做得好”。这为实验室之外的利益相关方提供了参与技术走向的途径,并形成不依赖单一实验室实践的可依赖原则。
国际标准要解决的三类挑战
文章列出国际标准需应对的三大问题:一是碎片化,各国评估、报告要求和事件定义冲突,难以比较证据和应对跨境风险;二是集体行动困境,各国独立行动可能产生谁都不想要的结果,RSI可能加速AI研究,超出集体理解和监督能力;三是能力不均,前沿开发与专业知识分布不均,加剧前两个问题。这些挑战对开源和闭源模型都适用。
两项关键机制:标准网络与测量协议
文章提出两项核心机制。第一,利用新兴的AI安全研究所网络(如澳、加、德、法、肯、日、韩、新、印、英等),通过CAISI和各国产业机构推动互补的国家与国际标准,聚焦前沿模型和自动化AI研究的收益风险管理。第二,建立共同测量与事件报告协议,包括RSI进展评估、人类监督触发条件、事件分类与报告阈值。这些标准不构成许可证或强制预审。
美国主导的动因与地缘考量
文章认为美国应主导全球前沿AI技术标准,因为其AI产业处于技术前沿,且在金融、贸易、防务、技术和信息系统等关键领域拥有全球网络优势。现在领导将决定美国是塑造全球AI框架,还是面对一个碎片化、不均且充满冲突的体系。地缘竞争不仅关乎技术领先,也关乎AI采用与扩散,后者可能取决于谁在推动现实合作和合理规则。
Q&A
什么是递归自我改进(RSI)?
递归自我改进(RSI)是指AI系统承担越来越多开发下一代AI的工作,从而日益驱动一个自我改进的过程,即使人类仍然参与其中。随着这一过程变得更加自动化,AI进展的速度可能会迅速加快。
为什么需要为前沿AI制定国际标准?
国际标准可以解决三个关键挑战:碎片化(不同国家的评估、报告要求和事件定义可能冲突,难以比较证据和应对跨境风险)、集体行动(各国独立行动可能产生谁都不想要的结果,RSI可能加速AI研究超出集体理解和监督能力)、能力不均(前沿开发活动分布不均,加剧上述问题)。标准有助于回答“在缓解灾难性AI风险方面,什么是好的做法?”
OpenAI提出的两项关键机制是什么?
两项机制是:(1) 通过各国AI安全研究所网络推动互补的国家和国际前沿标准,重点关注前沿AI模型和开发者(以能力基准衡量)以及自动化AI研究(包括RSI)的收益-风险管理;(2) 建立共同的测量和事件报告协议,以促进更好的集体行动,包括评估RSI相关进展、人类监督触发条件、事件分类与报告等。
为什么美国应该领导制定全球AI标准?
美国在AI行业处于技术前沿,并在金融、贸易、国防、技术和信息系统等关键领域拥有特权全球网络地位。现在领导将决定美国是塑造全球AI框架,还是目睹一个碎片化、不均衡和充满冲突的系统在其周围形成。此外,地缘政治竞争不仅关乎技术领先,还关乎AI的采用和扩散,这越来越取决于谁在推动现实的合作和合理的规则。
RSI可能带来哪些风险?
如果没有适当的谨慎,RSI可能导致人类失去对AI发展的实际控制,无法对不再理解的研究过程进行监督。从那时起,AI可能变得更危险、更不协调,总体上对人类构成威胁。Hugging Face事件虽然不是RSI的直接结果,但预示了在没有强大保障和协调的情况下可能变得更严重的风险类型。
国际标准将涵盖哪些具体领域?
国际标准将涵盖:评估RSI相关的AI进展和AI公司内自主研究的数量;对自动化AI研究的人类监督,包括哪些过程应触发立即人工审查;对齐和自动化AI研究问题的事件分类、跟踪、报告和响应,如共同的事件严重程度和报告阈值。此外,关键基础设施运营商和政府应建立安全沟通渠道,分享国家安全关切、新兴漏洞和最佳实践。