内容提要
Databricks团队通过ai_parse_document将图表提取为结构化JSON,结合轻量文本检索,显著提升图表检索和智能体回答准确率,优于大型多模态嵌入模型。在ViDoRe V3和Chart-RAG基准测试中,该方法表现优异,且模型更小、开销更低。未来将集成至Genie,改善企业文档图表问答。
延伸解读
结构化提取为何有效
文章指出,传统文本检索只能搜索文本,图表标题或说明可能遗漏关键数值,导致检索错误或无法回答细粒度问题。通过ai_parse_document将图表转为结构化JSON,将精确数值纳入索引,使检索和回答都能利用这些数据,从而提升准确率。这解释了为何结构化提取能弥补纯文本RAG的不足。
轻量模型的优势
该方法使用300M参数文本嵌入模型,相比大型多模态模型(如ColQwen2.5-3B)体积小约10倍,但回答准确率更高。在ViDoRe V3和Chart-RAG上分别达到75.9%和75.1%的正确率,超过四种多模态基线。这表明结构化预处理可以以更低开销获得更优效果,对资源受限的企业应用更具吸引力。
视觉上下文的补充作用
尽管结构化JSON已提升性能,但文章发现,在回答时额外提供图表图像仍能带来增益:Chart-RAG上提升4个百分点,ViDoRe V3上提升2.6个百分点。这说明某些问题依赖图表外观而非数值,因此结合JSON和图像可进一步优化答案质量,但需权衡图像传递的额外开销。
Q&A
Databricks团队如何提升智能体对图表数据的检索和回答准确率?
Databricks团队通过ai_parse_document将图表提取为结构化JSON,并结合轻量级文本检索模型(300M参数)建立索引,从而提升图表检索和智能体回答准确率。
为什么文本检索系统在图表问题上表现不佳?
文本检索系统只能搜索文本空间,而图表信息通常以图像形式存在。即使生成图表标题或描述,也可能遗漏图表中的具体数值,导致无法回答需要精确读取图表数据的问题。
结构化图表JSON相比大型多模态嵌入模型有什么优势?
结构化图表JSON方法使用更小的模型(300M参数)和更低的计算开销,但在ViDoRe V3和Chart-RAG基准测试中,回答准确率超过了ColQwen2.5-3B等大型多模态嵌入模型,同时仅需传递少量图像。
在图表检索中,添加图像对回答准确率有多大提升?
在检索结果中附加图像(与JSON一起)在Chart-RAG数据集上提升了4个百分点,在ViDoRe V3子集上提升了2.6个百分点。
Databricks的图表检索管道是如何构建的?
管道使用ai_parse_document提取文档内容(包括图表的结构化JSON),ai_prep_search将内容转换为检索块,ai_search建立索引,并连接到Genie进行检索和回答。
未来Databricks在图表处理方面有什么计划?
未来将把图表JSON增强集成到ai_parse_document中,使文档解析自动包含图表值,并计划在Genie One中提供该能力,以改善PDF图表相关问题的回答。