Databricks团队通过ai_parse_document将图表提取为结构化JSON,结合轻量文本检索,显著提升图表检索和智能体回答准确率,优于大型多模态嵌入模型。在ViDoRe V3和Chart-RAG基准测试中,该方法表现优异,且模型更小、开销更低。未来将集成至Genie,改善企业文档图表问答。
本文提出了一个用户意图感知的图表检索框架WYTIWYR,利用多模态输入融合显式视觉属性和隐含的用户意图。该框架可以让用户自定义属性,同时利用CLIP模型将文本和图片映射到一个统一的投影空间。实验结果表明,该方法相比于HOG和CNN更能满足用户的检索需求。
完成下面两步后,将自动完成登录并继续当前操作。