内容提要
论文复现是科学基石,但机器学习领域面临可复现性危机。Inherent Labs团队训练了270亿参数的AI智能体Faraday,利用Codex GPT-5.5作为工具,在73%的分布内任务和60%的AI for Science任务上超越Claude和GPT-5.5。Faraday通过自动生成任务空间和稳定GRPO后训练,展现出更强的科学严谨性,能指导更大模型工作,提升复现能力。
延伸解读
小模型指挥大模型:Faraday 的独特范式
Faraday 仅有 270 亿参数,却能指导 5 万亿参数的模型工作,并获得实际性能提升。这种“小模型负责科研判断,大模型负责工程执行”的范式,与单纯追求参数规模的传统思路形成对比。文章指出,未来 AI 科学家的竞争可能不再只是参数规模之争,而转向科研判断、工具调用与人机协作能力。
论文复现的三大挑战与应对
论文复现对 AI 智能体提出三个挑战:信息不完备(论文是有损压缩)、开放式探索(现有智能体偏向封闭问题)、缺乏明确奖励函数。Faraday 通过自动生成任务空间、稳定 GRPO 后训练等方法应对这些挑战,在 73% 的分布内任务和 60% 的 AI for Science 任务上超越 Claude 和 GPT-5.5。
提示词优化无法替代后训练
研究团队对 Codex 基线进行了 24 轮自动提示词优化,但优化后的提示词并未带来实际性能提升,与 Faraday 的差距依然存在。这表明后训练带来的能力提升无法仅通过提示词工程获得,强调了强化学习在培养科研判断力中的关键作用。
“想象式”复现:创新能力的初步证据
在“想象式”复现测试中,Faraday 在 20 个反事实任务变体中的 19 个上优于 Codex,显示出一定的创新能力。但研究人员谨慎指出,评分标准评判器未针对这些任务验证,结论仍需未来研究确认。这提示我们,AI 科学家的创新能力评估仍需更严谨的方法。
Q&A
Faraday是什么?它有什么特点?
Faraday是由Inherent Labs团队训练的AI科学家智能体,拥有270亿参数,能够复现科研论文。它使用Codex GPT-5.5作为工具,在73%的分布内任务和60%的AI for Science任务上超越Claude Opus 4.8和GPT-5.5。Faraday展现出更强的科学严谨性,能指导5万亿参数的模型工作。
论文复现对现有AI智能体有哪些挑战?
论文复现对现有AI智能体有三个挑战:一是问题信息不完备,论文是对研究过程的有损压缩,遗漏细节;二是现有AI智能体主要针对封闭式问题训练,而论文复现需要开放式探索;三是缺乏明确的奖励函数,难以进行持续优化。
Replica任务空间是如何构建的?
Replica任务空间由242个训练任务和68个测试任务组成,来自100篇机器学习和AI for Science论文。每个任务要求智能体复现论文中的一张结果图,智能体获得图表遮蔽的论文,有60分钟时间限制,使用1/7 H200 GPU。任务通过三个视觉语言处理阶段自动生成,由Gemini 2.5 Pro驱动,包括扫描、定位和遮蔽。
Faraday的后训练方法是什么?如何保证稳定性?
Faraday采用修改的GRPO后训练方法,基于Replica任务空间对Qwen3.6-27B进行训练。为保证稳定性,使用三次独立评判结果的平均值计算奖励,并要求评判器生成逐轮权重进行信用分配。训练使用LoRA微调,秩128,学习率6e-6,批次包含10个任务,每个任务8次运行。
Faraday在哪些方面优于Claude和Codex?
Faraday在实验深度、论断复现和视觉保真度方面优于基线模型,在科学诚信和实现忠实度方面与Claude相当。在分布内任务上,Faraday在73%的任务中超过Claude和Codex;在分布外任务上,在60%的任务中超过。
Faraday的定性分析显示了哪些科研严谨性?
定性分析显示,Faraday会真正实现实验所要检验的机制,而基线模型往往硬编码预期输出或过度简化;Faraday在实验范围上更全面,能复现更多内容,避免不必要的删减。
Faraday对想象式复现的泛化能力如何?
在20个反事实任务变体中,Faraday在19项上优于Codex,表现出更强的创新能力。但研究人员指出,评分标准评判器未针对想象式任务验证,结论需进一步研究。
Faraday的CAT范式有什么意义?
CAT范式让AI具备科研判断力,决定研究方向、划定实验范围、判断结果可信度。这种范式为AI能力发展和安全提供新思路:小型模型负责科研判断,强大模型负责工程执行。未来竞争可能转向科研判断、工具调用和人机协作能力。