内容提要
在2026杭州云栖大会上,基元律动CTO韩凯指出,多模型异构并存将成为长期趋势。其开源项目OpenSquilla通过模型路由,在保持99.96%任务质量的同时降低成本88.9%。他还提出面向RSI的反馈闭环,将Agent运行经验用于模型迭代,NeoHorse-1系列模型经后训练后多项评测得分提升,初步验证了该路径可行。
延伸解读
多模型异构:长期趋势下的调度挑战
韩凯指出,多模型长期异构并存、算力资源多元供给将成为大模型产业的长期结构。随着Agent任务复杂化,一次任务可能涉及数十次模型调用,任务表现不仅取决于模型本身,还取决于模型选择、工具调用与上下文管理等系统能力。这意味着单纯追求单一最强模型并非最优解,如何根据每一步需求动态调度不同模型,成为提升Agent效能的关键课题。
模型路由的实测收益与适用边界
基元律动通过开源项目OpenSquilla验证模型路由价值。在特定测试配置下,其端到端Agent评测保留了固定旗舰模型基线99.96%的任务质量,同时成本降低88.9%;在DRACO深度研究评测中,多模型协同得分超过最强单模型基线,成本约为其三分之一。这些结果展示了调度在特定任务中的成本与效果优势,但需注意其依赖于具体测试配置,实际部署效果可能因场景而异。
RSI反馈闭环:从运行经验到模型迭代
韩凯提出面向RSI的反馈闭环:以场景能力需求为牵引,通过评测识别模型与调度策略的改进方向,针对性优化后再应用于场景验证。这一机制将应用、评测与迭代连接起来。NeoHorse-1系列基于通义Qwen3.5底座后训练,初版技术报告显示,4B版本宏平均得分从58.94提升至64.87,9B版本从65.60提升至69.04,初步验证了利用Agent运行经验改进模型的可行性。
生态合作与基础设施支撑
基元律动与阿里云围绕Qwen系列开展场景测试、评测和应用验证,并在自身Harness与Agent产品中持续使用模型、积累反馈,推动新版本接入TokenRhythm路由平台。基础设施方面,阿里云提供云服务支持,无问芯穹为NeoHorse-1的训练与推理提供算力支持及优化。这种合作模式表明,Agent持续进化不仅依赖算法创新,也需要算力与云服务的协同支撑。
Q&A
基元律动在云栖大会上提出的多模型趋势是什么?
基元律动CTO韩凯在2026杭州云栖大会上指出,多模型长期异构并存、算力资源多元供给将成为大模型产业的长期结构。随着Agent承担越来越复杂的任务,如何组织不同模型并将应用反馈转化为模型改进依据,成为新的技术课题。
OpenSquilla模型路由在成本和任务质量上的表现如何?
据基元律动公布的端到端Agent评测结果,在特定测试配置下,OpenSquilla保留了固定旗舰模型基线99.96%的任务质量,同时将成本降低88.9%。在DRACO深度研究评测中,多模型协同配置的得分超过该组实验中的最强单模型基线,成本约为其三分之一。
什么是面向RSI的反馈闭环?
面向RSI(递归式自我改进)的反馈闭环是指:以场景中的能力需求为牵引,通过评测识别模型与调度策略的改进方向,开展针对性优化,再将升级后的能力应用于场景中验证效果。这一机制将模型应用、能力评测与后续迭代连接起来,探索Agent在持续验证与优化中提升任务表现的路径。
NeoHorse-1系列模型后训练后评测得分提升了多少?
根据NeoHorse-1初版技术报告,在十项基准评测中,4B版本的宏平均得分由58.94提升至64.87,9B版本由65.60提升至69.04。其中,4B后训练版本在VitaBench、τ²-Bench、PinchBench、QwenClawBench和HumanEval五项评测中超过Qwen3.5-9B底座模型,整体平均得分也进一步接近9B底座。
基元律动与阿里云、无问芯穹有哪些合作?
基元律动与阿里云围绕Qwen系列开展场景测试、评测和应用验证,在自身Harness与Agent产品中持续使用模型、积累反馈,并推动新版本接入TokenRhythm路由平台。基础设施方面,阿里云为相关业务运行提供云服务支持,无问芯穹为NeoHorse-1的训练与推理提供算力支持及基础设施优化。
Harness在Agent任务中扮演什么角色?
Harness是支撑Agent执行任务的运行框架,模型路由是其中的一项关键能力。不同模型在能力、成本和响应速度上各有特点,复杂任务需要根据每一步的需求选择合适的模型。模型异构适配与算力异构调度,也需要相应的专业能力支撑。