内容提要
文章介绍了决策模型Jev在分类任务中的实验,测试了重排序、减少重复结果、查询理解和语义分块。重排序中Jev优于交叉编码器,但迭代法收益有限;结合MMR可兼顾相关性与多样性;查询理解需谨慎过滤,短查询易误判;语义分块在QASPER上IoU提升13%。建议RAG优先用其分块,产品搜索结合MMR,查询理解潜力大但需更多验证。
延伸解读
重排序:Jev 性价比高,但迭代法不划算
在 NFCorpus 的 100 条查询上,Jev 的三种重排序方法均优于本地交叉编码器,且单次请求的 Score 方法已接近迭代十次的 Iterative 效果。迭代法虽得分略高,但每次查询需十次请求,收益微小。因此,若追求效率,优先选择单次请求的 Jev Score;若需本地执行或更低成本,交叉编码器仍是可选方案,但需接受质量差距。
减少重复结果:Jev 与 MMR 结合可平衡相关性与多样性
在 WANDS 电商数据上,纯 Jev 重排序提升了相关性,但近重复对仍多且产品类别减少;Qdrant 内置 MMR 能增加多样性却损失相关性。将 Jev 的分数作为 MMR 的相关性信号,或先 MMR 再 Jev 重排序,能在保持相关性高于混合搜索的同时,显著减少重复。对于产品搜索,这种组合比单一方法更实用。
查询理解:过滤需谨慎,短查询易误判
在 Amazon-C4 长查询上,Jev 分类路由配合分层过滤与提升策略,平均效果优于纯混合搜索。但短查询如“apple”被高置信度误判为食品,导致电子产品被过滤。文章建议:仅在非常确定时过滤,否则用提升;对短查询可尝试仅提升或提供更多上下文。采用前务必用自身查询和边缘案例验证。
语义分块:Jev 提升证据密度,但有 API 成本
在 QASPER 的 407 篇论文上,Jev 通过判断句子间是否开启新主题来分块,相比固定大小、递归和基于嵌入的分块器,IoU 平均提升 13%,精确率和召回率也有提高。代价是文本需发送至 API,约每百万文档 token 0.27 美元,而其他分块器可本地免费运行。对于 RAG 场景,这是值得优先尝试的改进点。
Q&A
Jev是什么?它和传统分类器、零样本分类器以及生成式LLM提示相比有什么不同?
Jev是TypeSafe推出的决策模型,通过OpenRouter提供服务。与需要训练数据的任务特定分类器不同,Jev无需训练即可在运行时使用新标签;与零样本分类器相比,Jev的输出被约束在候选标签内;与生成式LLM提示相比,Jev速度更快、成本更低,且不会生成选项之外的答案。
在重排序任务中,Jev的表现如何?哪种Jev方法最值得推荐?
在NFCorpus的100个查询上,Jev的三种方法(Score、Choice、Iterative)均优于BGE-small基线,且提升幅度均超过两个本地交叉编码器。其中Iterative方法得分最高,但仅比Score方法高出不到0.02,却需要10倍请求量。因此推荐使用Jev Score作为默认方法,Iterative性价比不高。
如何在使用Jev重排序的同时减少搜索结果中的重复项?
可以将Jev的重排序分数作为MMR(最大边际相关性)的相关性信号:要么用Jev的答案替换MMR的相关性项,要么先运行Qdrant的MMR再让Jev对前20个结果重排序。这两种方法都能在保持相关性高于混合搜索基线的同时,减少近重复项并增加产品多样性。
Jev在查询理解中如何用于分类过滤和提升?效果如何?
在索引时,Jev为每个产品打上类别标签并存储为payload;在搜索时,Jev对每个产品类别与查询进行评分。若评分≥0.9,则过滤到该类别;若在0.5到0.9之间,则提升匹配产品;低于0.5则不操作。在Amazon-C4的300个查询上,这种分层过滤和提升策略平均优于纯混合搜索,但短查询(如“apple”)可能因歧义导致过滤错误,需谨慎测试。
Jev用于语义分块的效果如何?相比传统分块方法有什么优势?
在QASPER数据集的407篇论文和1297个问题上,Jev通过判断句子间是否开始新主题来进行分块,在匹配平均块大小的情况下,相比固定大小、递归和基于嵌入的分块器,IoU平均相对提升13.0%,精确率提升11.2%,召回率提升9.1%。优势在于能更准确地保留证据段落,但成本约为每百万文档token 0.27美元,且需要调用API。
根据文章建议,在实际应用中应该优先尝试Jev的哪些用途?
对于RAG,建议优先使用Jev的分块器,因为它易于设置且不增加查询时开销;对于产品搜索,建议结合Jev的相关性分数与MMR来减少重复并保持相关性;查询理解潜力最大但需谨慎,应测试歧义查询后再信任类别预测进行过滤;暂时跳过迭代重排序,因为其收益小但请求成本高。