内容提要
Hermes Agent利用英伟达Nemo Relay,从150万条对话中识别无效操作,实施16项改进,实现工具报错归零,显著提升弱模型任务效率。单次请求节省700 Token,重复技能查看节省2.5万Token。优化聚焦认知效率而非算力,使本地小模型高效运行,与DeepSeek V4 Flash搭配,大幅降低AI代理使用成本。
延伸解读
优化思路:从“算力”转向“认知效率”
传统优化聚焦于推理速度和内存占用,而Hermes这次通过分析150万条对话,发现大量Token浪费源于代理的无效操作,如重复加载技能描述、截断读取后继续执行等。改进后,弱模型的任务完成轮次、工具调用次数和耗时均下降,工具报错归零。这表明,提升代理的“工作习惯”比单纯堆算力更能降低成本,尤其对本地小模型友好。
Nemo Relay:不只是监控,更是优化引擎
Nemo Relay作为可观测性平台,通过生命周期钩子和LLM网关收集数据,其自适应层能分析执行轨迹并自动注入优化提示。Hermes团队利用其ATOF基准测试套件验证了16项改进,460次CI检查全部通过。这展示了可观测性工具在代理优化中的关键作用,不仅用于监控,还能驱动系统性改进。
与DeepSeek V4 Flash的协同效应
DeepSeek V4 Flash 0731激活参数仅130亿,但在Terminal Bench 2.1上得分82.7,逼近顶级模型,且API定价极低。Hermes的优化减少了Token消耗,使弱模型也能高效运行,两者结合大幅降低了AI代理的使用成本。这提示开发者,选择轻量模型配合高效代理框架,可在预算有限时实现接近顶级模型的性能。
Q&A
Hermes Agent 借助英伟达 Nemo Relay 进行了哪些优化?
Hermes Agent 利用 Nemo Relay 的观测能力,从 150 多万条真实对话记录中识别无效操作和工具报错,实施了 16 项底层改进,包括精简工具描述(Schema Diet)、重复技能查看去重、可恢复截断溢出、工具报错恢复等,最终实现工具报错归零,显著提升弱模型的任务效率。
Schema Diet 优化具体节省了多少 Token?
Schema Diet 通过精简工具描述文档,每次请求可节省约 700 个 Token。
为什么 Hermes 的优化对弱模型特别友好?
因为优化聚焦于认知效率而非算力,通过减少无效轮次、工具报错和重复加载,让弱模型(如 130 亿参数模型)也能高效运行复杂任务,无需依赖强大算力。
Nemo Relay 在优化中扮演了什么角色?
Nemo Relay 是代理可观测性平台,通过生命周期钩子和 LLM 网关收集代理执行数据,并利用自适应层分析轨迹、注入优化提示,为改进提供数据支撑和验证。
Hermes 优化后,工具报错是如何归零的?
通过一系列改进,如被阻止命令自动恢复、当前工作目录回显、失败提示、写入验证、多路径恢复等,提前堵住可能导致报错的路径,使工具报错几乎清零。
DeepSeek V4 Flash 0731 与 Hermes 优化搭配有什么优势?
DeepSeek V4 Flash 0731 是激活参数仅 130 亿的轻量模型,但 Agent 能力强劲,在 Terminal Bench 2.1 上得分 82.7,且 API 定价极低。与 Hermes 优化结合,相当于给省油小车配了顶级导航,大幅降低 AI 代理的使用成本。
Hermes 优化对强模型有什么影响?
对于强模型,优化后任务完成质量与之前持平(Parity),但每个任务净节省约 1.4K Token,实现了降本增效。
这次优化一共包含多少个 PR 和 CI 检查?
整个优化批次包含 16 个 PR(15 个功能改进加 1 个集成修复),大约 460 次 CI 检查全部通过。