内容提要
美团开源搜索智能体评测基准LoHoSearch,旨在解决现有评测分数饱和、难以区分模型能力的问题。该基准利用知识图谱校准,更贴近实体与关系验证,覆盖长尾查询和拆解结果。文章强调搜索智能体落地需关注基础设施问题,建议团队用真实任务验收,重视错误解释而非总分,作为上线前的试金石。
延伸解读
评测饱和的陷阱
当评测分数普遍偏高时,模型能力的区分度会下降,容易让团队误以为模型已经足够强大。但真实场景中,用户查询往往更复杂,涉及多源查证、信息冲突和实体混淆等问题。高分可能只是模型熟悉了题型,而非真正具备搜索推理能力。因此,评测基准需要不断更新,以保持对模型能力的有效区分。
知识图谱校准的价值
LoHoSearch 利用知识图谱进行校准,将答案验证从文本相似度转向实体、关系和路径的验证,这有助于识别模型拼凑看似合理但实际错误的答案。对于团队选型,应关注基准能否覆盖长尾查询,以及能否提供分项结果而非总分,以便在排障时定位具体问题,如检索遗漏、解析错误或推理链断裂。
落地中的基础设施挑战
搜索智能体的落地不仅依赖模型能力,还涉及抓取频率控制、外部站点降级、缓存策略、全链路记录和敏感内容审计等基础设施问题。模型能力强但若消耗大量 token、运行时间长或依赖过多外部调用,成本和稳定性将成为主要瓶颈。因此,评测应作为上线前的试金石,而非排行榜玩具。
内部验收的实践建议
普通团队无需急于训练或修改模型,但可以借鉴 LoHoSearch 的思路改进内部验收:挑选真实问题,保留来源、步骤和失败原因,在接近线上环境的条件下测试。分数高是加分项,但能解释错误原因才更适合生产环境。这有助于建立稳定的证据链,提升搜索智能体的实际可用性。
Q&A
LoHoSearch是什么?它由谁开源?
LoHoSearch是美团技术团队开源的面向搜索智能体(Search Agent)的评测基准,旨在解决现有评测分数饱和、难以区分模型能力的问题。
为什么说现有的搜索智能体评测已经饱和?
因为顶尖模型在现有评测上的准确率已从早期的30%左右涨到90%以上,分数拉不开,难以区分模型能力,导致研发团队容易产生模型能力很强的错觉,但实际应用中仍会出错。
LoHoSearch如何解决评测饱和问题?
LoHoSearch利用知识图谱校准搜索智能体能力,使评测更接近实体、关系和路径的验证,而不是单纯依赖文本相似度,从而更准确地评估模型在复杂搜索任务中的表现。
在团队选型时,使用LoHoSearch应该关注哪些方面?
应关注两点:一是能否覆盖业务中的长尾查询(如别名、历史版本、跨语言资料、过期文档);二是评测结果能否拆开看,而不是只看总分,以便定位具体问题(如检索漏了、网页解析坏了、推理链断了等)。
搜索智能体落地时面临哪些基础设施问题?
包括抓取频率控制、外部站点失败降级、缓存策略、全链路记录、敏感内容审计等,这些不在演示视频中,但会影响实际运维。此外,模型每次任务消耗的token、运行时间和外部页面调用也会带来成本和稳定性问题。
普通团队如何利用LoHoSearch的思路改进内部验收?
可以挑选一批真实问题,保留来源、步骤和失败原因,让模型在接近线上环境的条件下运行。分数好看可以加分,但能解释错误原因才更适合进入生产环境。