通过结构化图表提取增强智能体检索

通过结构化图表提取增强智能体检索

💡 原文英文,约1300词,阅读约需5分钟。
📝

内容提要

Databricks团队通过ai_parse_document将图表提取为结构化JSON,结合轻量文本检索,显著提升图表检索和智能体回答准确率,优于大型多模态嵌入模型。在ViDoRe V3和Chart-RAG基准测试中,该方法表现优异,且模型更小、开销更低。未来将集成至Genie,改善企业文档图表问答。

🔎

延伸解读

结构化提取为何有效

文章指出,传统文本检索只能搜索文本,图表标题或说明可能遗漏关键数值,导致检索错误或无法回答细粒度问题。通过ai_parse_document将图表转为结构化JSON,将精确数值纳入索引,使检索和回答都能利用这些数据,从而提升准确率。这解释了为何结构化提取能弥补纯文本RAG的不足。

轻量模型的优势

该方法使用300M参数文本嵌入模型,相比大型多模态模型(如ColQwen2.5-3B)体积小约10倍,但回答准确率更高。在ViDoRe V3和Chart-RAG上分别达到75.9%和75.1%的正确率,超过四种多模态基线。这表明结构化预处理可以以更低开销获得更优效果,对资源受限的企业应用更具吸引力。

视觉上下文的补充作用

尽管结构化JSON已提升性能,但文章发现,在回答时额外提供图表图像仍能带来增益:Chart-RAG上提升4个百分点,ViDoRe V3上提升2.6个百分点。这说明某些问题依赖图表外观而非数值,因此结合JSON和图像可进一步优化答案质量,但需权衡图像传递的额外开销。

Q&A

Databricks团队如何提升智能体对图表数据的检索和回答准确率?

Databricks团队通过ai_parse_document将图表提取为结构化JSON,并结合轻量级文本检索模型(300M参数)建立索引,从而提升图表检索和智能体回答准确率。

为什么文本检索系统在图表问题上表现不佳?

文本检索系统只能搜索文本空间,而图表信息通常以图像形式存在。即使生成图表标题或描述,也可能遗漏图表中的具体数值,导致无法回答需要精确读取图表数据的问题。

结构化图表JSON相比大型多模态嵌入模型有什么优势?

结构化图表JSON方法使用更小的模型(300M参数)和更低的计算开销,但在ViDoRe V3和Chart-RAG基准测试中,回答准确率超过了ColQwen2.5-3B等大型多模态嵌入模型,同时仅需传递少量图像。

在图表检索中,添加图像对回答准确率有多大提升?

在检索结果中附加图像(与JSON一起)在Chart-RAG数据集上提升了4个百分点,在ViDoRe V3子集上提升了2.6个百分点。

Databricks的图表检索管道是如何构建的?

管道使用ai_parse_document提取文档内容(包括图表的结构化JSON),ai_prep_search将内容转换为检索块,ai_search建立索引,并连接到Genie进行检索和回答。

未来Databricks在图表处理方面有什么计划?

未来将把图表JSON增强集成到ai_parse_document中,使文档解析自动包含图表值,并计划在Genie One中提供该能力,以改善PDF图表相关问题的回答。

🏷️

标签

➡️

继续阅读