内容提要
AI圈热炒新词RSI(递归自我改进),指AI自主写代码、跑实验、改进下一代模型,思想可追溯至1965年“智能爆炸”设想。OpenAI、Anthropic已实现部分自动化研究。同时,Anthropic、OpenAI高管渲染AI末日风险,呼吁减速监管,英伟达黄仁勋则反驳。文章认为,末日论与反末日论之争,实质是算力、资本与产业利益的分配博弈。
延伸解读
RSI 的自主性分级:从 L1 到 L5
文章引用预印本《The Last AI Built by Humans》,将 RSI 自主性划分为 L1 至 L5。L1 执行人类方案,L2 自主寻找策略,L3 决定获取哪些经验,L4 将部署反馈转化为持续改动,L5 则改进机制本身。这一分级帮助读者理解 RSI 并非单一概念,而是从辅助工具到自我迭代系统的渐进过程。
自动化研究的现实进展
OpenAI 内部报告显示,其智能体每投入一个人类工作日,运行时长相当于 3.1 个工作日,已实现“自动化研究实习生”目标。Anthropic 则让 Claude 自主查文献、提方案、生成数据并迭代,在约 60 小时内测试 50 多种方案,用约 2400 条样本将早期 Opus 4.8 的对齐成绩提升至接近正式版水平。这些案例表明 RSI 已有初步实践。
技术瓶颈:遗忘与判断力
RSI 面临两大难题:一是持续学习中的“灾难性遗忘”,更新太激进会丢失原有能力,太保守则学不到新知识;二是研究判断力难以自动化,AI 可以优化代码,却难以判断失败实验是方向错误还是值得继续探索。从“怎么做”到“该做什么”的跨越,仍高度依赖人类直觉。
末日论与反末日论的利益博弈
Anthropic、OpenAI 高管渲染 AI 末日风险,呼吁减速监管;英伟达黄仁勋则反驳安全与创新并非二选一。文章指出,安全叙事可能成为头部公司的合规壁垒,而反末日论则维护芯片、算力等硬件产业链利益。双方争论表面是人类存亡,实质是下一轮算力、资本与产业利益的分配。
Q&A
RSI 是什么?它的核心思想是什么?
RSI 是 Recursive Self Improvement(递归自我改进)的缩写,指 AI 自己写代码、自己跑实验、自己改训练流程,改完再传给下一代更强的新模型,形成不断加速的正反馈循环。其思想源头可追溯到 1965 年 I.J. Good 提出的“智能爆炸”设想。
RSI 和 AGI 有什么区别?
AGI 关注的是 AI 能否完成与人类相当的通用认知工作;而 RSI 关心的是 AI 能否改变产生这些能力的系统,并让下一轮改进变得更加有效。
RSI 的自主性分为哪几个层级?
根据预印本《The Last AI Built by Humans》,RSI 的自主性划分为 L1 至 L5 五个层级:L1 执行人类给出的改进方案;L2 自主寻找改进策略;L3 决定需要获取哪些经验;L4 把部署环境中的反馈转化成持续保留的改动;L5 改进机制本身也成为改进对象。
目前 OpenAI 和 Anthropic 在 RSI 方面有哪些实际进展?
OpenAI 已实现“自动化研究实习生”目标,系统能在人类指导下编写代码、运行实验、排查故障和分析结果;截至 8 月中旬,每投入一个人类工作日,其研究部门智能体运行时长相当于 3.1 个工作日。Anthropic 将自动化推进到安全研究,Claude 可自己查文献、提方案、生成训练数据、运行实验和评估结果;最接近“AI 训练下一代 AI”的实验中,较弱的 Claude Sonnet 5 帮助早期 Claude Opus 4.8 改善安全表现,约 60 小时内测试 50 多种方案,仅用约 2400 条训练样本就把对齐成绩推到接近正式版水平。
实现 RSI 面临哪些主要技术难题?
主要难题包括:模型需要不断吸收新经验又不能丢掉原有能力,更新过于激进可能导致“灾难性遗忘”,过于保守又可能学不到足够多新知识;更难自动化的是研究判断力,让 AI 判断一个失败实验意味着方向错误还是值得继续探索非常困难;真正的科学突破往往需要提出全人类都没想过的怪问题,这种从“怎么做到”到“该做什么”的跨越至今高度依赖人类直觉。
为什么说 AI 末日论与反末日论之争实质是利益分配博弈?
文章认为,末日论与反末日论表面争论人类会不会被 AI 毁灭,背后争夺的是下一轮算力、资本和产业利益如何分配。头部公司呼吁减速和加强安全审查,但能承担高额安全成本的恰恰是它们,这构成扼杀对手的壁垒;同时它们也是风险标准的定义者,保护公众也是在保护自己的领先位置。而英伟达反对 AI 危险论,是因为任何可能阻止买卡、建机房和增加电力供应的安全叙事都会冲击硬件产业链。