中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷

中国NeoLab时刻:EverMind用3篇论文,交出全栈自进化首份答卷

💡 原文中文,约9200字,阅读约需22分钟。
📝

内容提要

中国团队EverMind由盛大孵化,专注AI自进化,发布三篇论文解决技能、脚手架和模型权重难题。其HarnessBank提升Agent性能,SkillCorpus管理十万技能,DASH优化训练。相比海外NeoLab,EverMind构建全栈生态并开源,旨在实现AI持续学习与自我进化,引领下一代AI发展。

🔎

延伸解读

自进化AI的三大技术关卡

文章指出,实现AI自进化需攻克三道难关:脚手架(Harness)的自我改进易过拟合,技能(Skills)的规模化管理和检索困难,模型权重(Weights)的训练信号分配粗糙。EverMind的三篇论文分别针对这些难题提出解法,体现了从外围逻辑到底层算法的系统性布局。

HarnessBank的防过拟合设计

HarnessBank将“提出变更”与“归因变更”分离,由语言模型诊断和提补丁,确定性代码负责采样和检验,确保性能提升统计可靠。其装备基因库以“WHERE×WHY”为语义坐标存储,强调修复“病理”而非特定任务,并发现最优脚手架随模型主导病理变化,具备跨模型迁移的元能力。

DASH的监督信号优化

DASH针对传统同策略自我蒸馏(OPSD)对所有时间步均匀分配监督权重的问题,利用局部散度与序列均值的差距动态调整传播门,使高风险分叉点获得更远传播。实验显示,在多个数学推理基准上,DASH在多个模型规模上均取得最高分,且无需额外前向传递开销。

EverMind与海外NeoLab的对比

文章对比了RSI、Engram、Adaption Labs、Core Automation等海外NeoLab,指出它们多处于单点突破或早期研发阶段。EverMind则通过EverOS、Raven和DASH构建全栈生态,并坚持开源,GitHub Star数已超1.2万,形成类似Android的开发者生态护城河。

Q&A

EverMind团队是由哪家公司孵化的?其背景是什么?

EverMind由盛大集团孵化,延续了盛大创新院的研究基因。盛大创新院成立于2008年,由陈天桥创立,定位是纯粹探索技术前沿,不追求KPI。近三年盛大All in AI,通过内部孵化机制吸引顶尖AI人才,EverMind是其中一支研究型团队。

EverMind的三篇论文分别解决了自进化AI的哪些难题?

三篇论文分别对应自进化AI的三道难关:HarnessBank解决脚手架(Harness)的自我改进难题,避免过拟合;SkillCorpus解决技能(Skills)的规模化管理难题,聚合和策展十万级技能库;DASH解决模型权重(Weights)的训练信号分配难题,优化同策略自我蒸馏。

HarnessBank框架的核心创新是什么?

HarnessBank的核心创新在于将“提出变更”与“归因变更”彻底分离,语言模型只负责诊断失败和提出补丁,采样、测量和显著性检验由确定性代码控制,确保性能提升统计可靠。同时引入装备基因库(HGB),以“WHERE × WHY”语义坐标存档高性能脚手架,并设计分级装备筛选机制,有效防止过拟合。

SkillCorpus是如何构建的?它带来了什么性能提升?

SkillCorpus从约82.1万个原始技能中,通过多阶段多维度策略过滤,精选出96401个高质量技能,建立16个类别分类法,并从实用性、鲁棒性和安全性三维度进行质量控制。配合微调的检索技术栈,在SkillsBench、GDPVal和QwenClawBench三个基准上均获得稳定性能提升,其中SkillsBench提升最大,达7.5个百分点。

DASH算法是如何改进传统OPSD的?实验结果如何?

DASH(Divergence-Adaptive Supervision Horizons)将每个局部蒸馏信号与序列级均值的差距转化为自适应传播门,控制向后的多步聚合。当局部散度高于均值时,打开更大传播门,让监督信号传播更远;反之收窄。在AIME 2024、AIME 2025和HMMT 2025三个数学推理基准上,DASH在Qwen3-1.7B、4B、8B上均取得最高分,且无需额外前向传递开销。

EverMind提出的自进化四层框架是什么?

四层框架包括:任务层(优化单次任务执行,沉淀记忆和技能)、脚手架层(优化Agent外围运行逻辑,版本迭代)、模型层(优化模型权重,如LoRA微调)、元改进层(优化Evaluator、Data和Training Recipe,提升改进能力本身)。每层都有具体技术路径和验证机制。

EverMind与海外NeoLab(如RSI、Engram)相比有何优势?

EverMind的优势在于“三层并发”的全栈生态:同时覆盖非参数化长期记忆(EverOS)、Harness自进化(Raven)和底层权重训练优化(DASH),而海外团队多停留在单点突破。EverMind还坚持开源优先,GitHub Star超1.2万,构建了开发者生态护城河。

EverMind在开源和社区方面有哪些成果?

EverMind坚持开源优先,GitHub上累计超过1.2万颗Star(同期mem0为7千),并开源了长期记忆相关库(1.8万star)。此外,团队在一年内产出9篇高质量论文,其中数篇被ACL、KDD等顶会录用,并发布了评测基准EvoAgentBench,在Hugging Face同类benchmark上下载量第一。

🏷️

标签

➡️

继续阅读