闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

💡 原文中文,约3700字,阅读约需9分钟。
📝

内容提要

Prime Intellect的研究表明,开源模型结合Multi-Agent Harness在nanoGPT优化任务中表现接近顶级闭源模型,挑战了RSI的假设。实验发现模型间的差距不在于创意,而在于试错吞吐量。更便宜的开源模型负责监控实现,高效的试错机器能提升AI科研速度,加速AI研发迭代。

🔎

延伸解读

试错吞吐量比创意更关键

实验显示,18个模型最终找到的优化思路大同小异,但成绩差异显著。真正拉开差距的不是“想到什么”,而是“怎么试出来”:强模型会换seed、重新消融、验证信号真伪,甚至围绕GPU非确定性调整流程。这提示在AI科研中,快速验证和迭代的能力可能比单一创意更重要。

开源模型+Harness的性价比优势

Prime Intellect将监控和实现交给更便宜的开源模型,把判断留给强模型,从而降低试错成本。Kimi K3搭配Harness后成绩逼近Opus 5,说明在AI4AI中,不一定非要最强模型,高效的编排框架也能让开源模型追上来。这为资源有限的团队提供了另一种路径。

RSI剧本的另一种可能

传统RSI假设最强闭源模型率先突破并赢家通吃,但本实验显示,开源模型+Harness也能逼近顶级闭源模型。这意味着AI研发的加速不一定依赖单一模型的智力跃升,而是可以通过改进外围科研基础设施(如持久IPython内核、多Agent系统)来实现,为开源社区带来更多机会。

Q&A

Prime Intellect在最新研究中提出了什么核心观点?

Prime Intellect提出,借助多智能体Harness,可以将监控和具体实现交给更小、更便宜的开源模型,从而让“AI开发AI”变得更便宜,甚至效果更好。

在nanoGPT优化任务中,Kimi K3搭配Prime Agent Harness取得了什么成绩?

Kimi K3搭配Prime Agent Harness后,在原始结果页中跑出了2930步的成绩,超过了GPT-5.6 Sol的3042步,距离Claude的旗舰模型Opus 5的2920步只差10步。

Prime Intellect的实验是如何设计的?

实验让18个前沿模型在nanoGPT训练任务中自主优化,目标是尽可能减少训练步数,将1.24亿参数GPT的验证集loss降到3.28以下。Agent会拿到代码仓库、规则手册和目标指令,在8张H200上运行,全程断网并锁进sandbox,人类基本退出。

实验发现模型之间的差距主要来自哪里?

实验发现,模型之间的差距不在于创意,而在于试错吞吐量。所有模型最终找到的idea都差不多,但强模型更擅长换seed、重新消融、判断信号真实性,从而更高效地试错。

Prime Intellect为什么将重点放到Multi-Agent Harness上?

因为大量工作落在写代码、跑实验、盯结果、做验证等环节,没必要每一步都调用最贵的前沿模型。让更便宜的开源模型负责监控和实现,把需要判断的环节留给更强的模型,可以降低试错成本,提高实验吞吐量,从而加速AI科研。

Prime Intellect的实验对RSI(递归自我改进)的经典剧本有何影响?

实验动摇了经典RSI剧本,即最强闭源模型率先跨过临界点后赢家通吃。它展示了另一种可能:模型不一定最强,只要科研机器足够高效,开源模型也能靠更高的试错吞吐量追上来。

实验中表现最好的模型是哪个?它达到了多少步?

表现最好的是Fable 5,最终做到2726步,从3290步baseline到2600步人类纪录的690步优化空间中,它吃掉了564步,相当于走完约82%。

Prime Intellect下一步计划是什么?

Prime Intellect下一步准备把Speedrun扩展到训练栈的更多环节,同时继续放大实验规模。

🏷️

标签

➡️

继续阅读