内容提要
企业架构与智能体设计中,AI智能体因网页搜索返回碎片信息,反复抓取页面导致token消耗暴涨48倍。自建索引预先清洗网页为完整文档,一次调用直接推理,成本降76%。三种检索方式中,自建索引支持跨记录查询,解锁复杂问题,且与开放搜索分工,分别负责发现与深度查询,显著降低检索税。
延伸解读
检索税的本质:上下文窗口中的隐性开销
文章指出,智能体通过搜索API获取的只是链接和摘要,必须自行抓取HTML、解析文本,这些预处理都在上下文窗口内按token计费。这种“检索税”不仅单次开销大,而且随着多轮搜索,上下文像滚雪球般膨胀,导致成本呈复利式增长。理解这一点,有助于开发者重新审视搜索调用返回的内容质量,而非一味优化提示词。
跨记录查询:自建索引的隐藏价值
文章强调,某些问题(如“上季度哪些目标账户招了数据或AI方向的领导”)无法从单个搜索结果中获取答案,需要将人物履历与新闻事件进行交叉比对。自建索引因持有完整结构化记录,能支持这种跨记录查询,而SERP和神经搜索因返回碎片信息而无法实现。这解锁了B2B销售、投资研究等场景中的复杂问题,价值远超单纯的成本节省。
工具分工:发现与深度查询的分离
文章提出,开放搜索擅长发现(如追踪突发事件),自建索引擅长深度查询(如获取完整履历)。将两者链式使用,而非混用,可避免每轮迭代都支付检索税。这种“工具分工”理念,比单纯追求模型能力或提示词优化更关键,提醒开发者根据查询类型匹配检索形态,从而显著降低token消耗。
Q&A
为什么AI智能体使用网页搜索时token消耗会暴涨48倍?
因为搜索API返回的是链接和摘要,智能体需要反复抓取页面、解析HTML、提取文本,这些操作都在上下文窗口中按token计费。随着搜索轮次增加,上下文像滚雪球一样膨胀,导致token消耗暴涨。实验显示,三跳循环的token消耗比纯记忆回答贵48倍。
什么是检索税?它是如何产生的?
检索税是指智能体在真正推理之前,为了获取和清洗网页内容而消耗的token开销。搜索API返回的碎片信息(如链接和摘要)不足以直接回答,智能体需要自行抓取页面、解析HTML、提取文本,这些操作按token计费,且每轮搜索都会重复产生,导致成本累积。
自建索引相比SERP和神经搜索有什么优势?
自建索引在查询前就爬取并清洗网页,返回完整文档,智能体可以直接推理,无需二次调用,检索税为零。而SERP返回链接和摘要,神经搜索返回高亮片段,都需要额外调用获取完整信息。自建索引还能支持跨记录查询,解锁复杂问题。
什么是跨记录查询?为什么SERP和神经搜索无法实现?
跨记录查询是指答案需要结合多条记录的信息才能得出,例如“上个季度哪些目标账户招了数据或AI方向的领导”。SERP和神经搜索返回的碎片信息不完整,无法进行记录间的关联,智能体只能手动拼接,导致上下文膨胀和token浪费。自建索引提供完整记录,才能支持这类查询。
如何降低AI智能体的搜索成本?
采用自建索引,预先清洗网页为完整文档,一次调用直接推理,可降低76%的token成本。同时,将开放搜索和自建索引分工:开放搜索负责发现,自建索引负责深度查询,避免重复抓取,进一步降低成本。
开放搜索和自建索引各自适合什么场景?
开放搜索适合发现型查询,如查谁担任什么职位、确认最新发布、追踪突发事件,时效性强。自建索引适合深度查询,如查完整履历、读全文、了解公司背景,目标明确且需要完整信息。两者应链式使用,而非互相替代。