内容提要
OpenMLE是首个面向递归自改进的全栈开源系统,由Horizon Research等团队开发。它将机器学习工程任务分解为四个原子演化算子,通过SFT+RL训练出35B参数的元进化代理Frontis-MA1,在MLE-Bench Lite上Medal Average从39.39%提升至60.61%,配合进化搜索框架达71.21%,超越GPT-5.5+Codex组合。系统由Gym、RL、Evo三组件构成闭环,代码、模型权重和数据集均已开源。
延伸解读
AI4AI与RSI:从辅助到自主的范式转变
传统AI开发依赖人类专家在循环中决策,而AI4AI旨在让AI自主优化ML工程流水线、训练策略和架构设计。递归自改进(RSI)是通向AGI的核心路径,OpenMLE通过将MLE任务分解为原子演化算子,使AI能够自我改进构建过程,形成能力增长闭环。这一转变意味着AI不再只是工具,而是逐渐成为自身发展的主导者。
原子演化算子:提升可解释性与可控性
OpenMLE将ML工程任务分解为Draft、Improve、Debug、Crossover四个原子算子,这种设计不仅使强化学习训练更可行,还增强了系统的可解释性和可控性。每个算子职责明确,便于组合和优化,为AI自主改进提供了清晰的操作单元,降低了复杂任务的学习难度。
开源模型挑战闭源组合:性能与资源效率
Frontis-MA1(35B参数)配合进化搜索框架,在MLE-Bench Lite上超越GPT-5.5+Codex组合,接近GPT-5.6 Sol和Kimi K3。这表明开源模型通过专门训练和搜索优化,能够在特定任务上匹敌甚至超越闭源商业方案,且资源消耗相对较低。这一结果凸显了开源AI在特定领域的竞争力。
组件互补性:模型与搜索框架的协同效应
在NatureBench Lite迁移实验中,模型能力贡献+20% Match-SOTA提升,搜索框架贡献+30%,证明两者是互补的正交组件。这意味着仅优化模型或仅依赖搜索都不足以最大化性能,需要协同发展。这一发现为AI4AI系统的设计提供了重要参考:模型与搜索策略的联合优化是关键。
Q&A
OpenMLE是什么?它由哪些团队开发?
OpenMLE是首个面向递归自改进(RSI)的全栈开源系统,由Horizon Research、Frontis.AI和清华大学联合团队开发。
Frontis-MA1模型是如何训练的?参数量是多少?
Frontis-MA1通过SFT+RL(监督微调和强化学习)训练,参数量为35B。
OpenMLE系统由哪三个核心组件构成?它们如何协作?
OpenMLE由Gym、RL和Evo三个组件构成闭环。Gym提供标准化的任务环境和反馈信号,RL训练模型掌握原子演化算子的使用策略,Evo基于进化算法搜索最优操作序列。三者形成“执行-评估-改进”的自循环结构。
四个原子演化算子分别是什么?各自的作用是什么?
四个原子演化算子是Draft(起草)、Improve(改进)、Debug(调试)和Crossover(交叉)。Draft从零生成完整流水线代码,Improve针对已有代码进行维度优化,Debug识别修复语法、运行时和逻辑错误,Crossover融合两个不同方案的优点。
Frontis-MA1在MLE-Bench Lite上的表现如何?相比基座模型提升了多少?
Frontis-MA1在MLE-Bench Lite上的Medal Average达到60.61%,相比基座模型的39.39%提升了21.22个百分点。
OpenMLE-Evo-Max是什么?它带来了多少额外提升?
OpenMLE-Evo-Max是基于进化算法的搜索框架,与Frontis-MA1配合使用,将Medal Average从60.61%进一步提升至71.21%,额外提升了10.6个百分点。
Frontis-MA1与GPT-5.5+Codex组合相比表现如何?
Frontis-MA1配合OpenMLE-Evo-Max的表现超越了GPT-5.5+Codex组合,接近GPT-5.6 Sol和Kimi K3。
OpenMLE的代码、模型权重和数据集是否开源?在哪里可以获取?
是的,OpenMLE的代码、模型权重和数据集均已开源,可在GitHub仓库(https://github.com/FrontisAI/OpenRSI)获取。