将文档分类扩展到10万+标签

将文档分类扩展到10万+标签

💡 原文英文,约1500词,阅读约需6分钟。
📝

内容提要

Databricks 测试了三种大规模文本分类方法:纯向量搜索、向量搜索结合AI Classify、直接调用前沿大模型。结果显示,向量搜索加AI Classify的工作流在35,000至100,000标签的基准测试中,准确率达0.81,比最强直接模型高5个百分点,成本仅为后者的百分之一,且无需重新训练,是成本与质量的最佳平衡。

🔎

延伸解读

为什么传统方法在大规模分类中失效

文章指出,正则表达式和关键词匹配在面对真实数据的格式变化时非常脆弱,需要频繁更新维护。而监督学习分类器则受限于训练数据的稀疏性和标签分布的长尾效应,难以覆盖所有标签,且容易对常见标签过拟合。此外,标签体系的频繁变动(如新增、废弃标签)也要求不断重新训练和部署模型,这些痛点促使企业转向基于LLM的方案。

向量搜索与AI Classify结合的优势

测试表明,仅用向量搜索虽然成本极低,但准确率比结合AI Classify的工作流低20多个百分点。而直接调用前沿大模型虽然能处理分类,但在标签数量超过上下文窗口时无法容纳全部标签,且成本高昂。相比之下,向量搜索先筛选出最相关的20个标签,再由AI Classify进行精细分类,既保证了准确率(0.81),又将成本控制在直接调用模型的百分之一,实现了成本与质量的最佳平衡。

标签体系变化时的灵活性

文章强调,当标签体系发生变化时,传统方法需要更新正则或重新训练模型,而向量搜索与AI Classify结合的工作流只需在每次任务开始时重新嵌入新标签并更新索引,无需重新训练或部署。这种灵活性使得企业能够快速适应业务需求的变化,降低了维护成本,特别适合标签频繁变动的场景。

Q&A

Databricks 测试了哪三种大规模文本分类方法?

Databricks 测试了三种方法:纯向量搜索、向量搜索结合 AI Classify、直接调用前沿大模型。

向量搜索加 AI Classify 的工作流在准确率和成本上表现如何?

在 35,000 至 100,000 标签的基准测试中,该工作流准确率达 0.81,比最强直接模型(Gemini 3.5 Flash)高 5 个百分点,成本仅为后者的百分之一。

为什么传统的正则表达式和关键词匹配方法在大规模分类中效果不佳?

传统方法依赖精确匹配,容易因真实数据的格式变化而失效;同时,真实标签分布长尾,缺乏每个标签的训练数据,且标签会不断变化,导致维护困难。

直接调用前沿大模型进行分类存在哪些问题?

当标签数量达到数十万时,模型难以在上下文窗口中容纳全部标签,且容易产生幻觉,返回不存在的标签;同时,处理大量文档时成本高昂。

向量搜索加 AI Classify 的工作流是如何实现的?

首先使用向量搜索(结合语义和词法相似度)为每个文档检索出最相关的 k 个标签(通常 k=20),然后将这些标签作为候选列表传递给 AI Classify 函数,由 AI Classify 返回最终预测。

向量搜索单独使用时的准确率和成本如何?

向量搜索单独使用时成本极低(约为 AI Classify 工作流的百分之一),但准确率比 AI Classify 工作流低 20 多个百分点。

当标签数量超过模型上下文窗口时,如何处理?

对于直接调用前沿模型,只能裁剪标签列表以适应上下文;而 AI Classify 工作流通过向量搜索先筛选出候选标签,避免了上下文超限问题。

AI Classify 工作流在标签变化时是否需要重新训练?

不需要。当标签变化时,只需移除已废弃的标签,并嵌入新标签,在每次工作流开始时更新索引即可,无需重新训练或部署。

🏷️

标签

➡️

继续阅读