内容提要
Databricks发布OfficeQA Pro V2基准,用于测试AI代理在企业级文档上的泛化推理能力。该基准基于美国财政部1793至2024年约12万页账目数据,含90个问题。前沿模型平均准确率仅37.5%,专用代理达41.1%,而Databricks Genie系统提升至60%。基准强调跨文档检索、解析和推理,仍具挑战性,旨在推动企业AI代理发展。
延伸解读
基准测试的定位与意义
OfficeQA Pro V2 是 Databricks 推出的新基准,旨在测试 AI 代理在企业级文档上的泛化推理能力。它基于美国财政部 1793 至 2024 年的账目数据,包含 90 个问题,要求跨文档检索、解析和推理。该基准的发布反映了企业 AI 代理面临的真实挑战,即文档集合多样且不断变化,而不仅仅是单一语料库上的表现。
当前模型的表现与差距
在 OfficeQA Pro V2 上,前沿模型平均准确率仅 37.5%,专用代理为 41.1%,而 Databricks Genie 系统通过预解析文档将准确率提升至 60%。这表明,尽管现有模型具备一定能力,但通过优化代理架构(如 Genie)可以显著提升性能,同时降低成本。然而,基准仍显示解析、时间校准和实体范围理解等失败模式,说明企业级接地推理尚未完全解决。
基准构建的自动化与挑战
与早期手动构建基准不同,OfficeQA Pro V2 使用内部库 asynth 自动化生成和验证问题,提高了效率和可扩展性。该基准的语料跨越 232 年,包含文档结构、会计惯例和术语的演变,对解析和推理提出了更高要求。例如,问题平均需要 6.7 个源文档,且部分问题涉及图表理解或外部信息检索,增加了评估的难度和真实性。
Q&A
OfficeQA Pro V2是什么?它由谁发布?
OfficeQA Pro V2是Databricks发布的一个新基准,用于评估AI代理在企业级文档上的泛化推理能力。它基于美国财政部1793至2024年约12万页账目数据,包含90个问题。
OfficeQA Pro V2与原始OfficeQA基准有何不同?
OfficeQA Pro V2使用全新的语料库(美国财政部账目),包含更多跨文档检索(平均6.7个源文档,而OfficeQA Pro约2个),且更强调泛化能力,以测试模型是否能在未见过的企业数据上表现良好。
前沿模型在OfficeQA Pro V2上的平均准确率是多少?
前沿模型(如Claude Code和Codex)的平均准确率仅为37.5%。
Databricks Genie在OfficeQA Pro V2上的表现如何?
Genie在相同模型下平均准确率提升24个百分点,最强配置达到60%,且成本更低,例如Claude Fable 5在Genie下性能提升14.4个百分点,成本降低约9倍。
OfficeQA Pro V2的语料库是什么?它有什么特点?
语料库是美国财政部发布的《收支账目》,包含约1400个PDF和12万页,覆盖1793至2024年。其特点包括文档结构、会计惯例和术语随时间演变,如早期使用长s和“do.”表示“同上”,后期出现图表和标准化目录。
OfficeQA Pro V2中的问题需要哪些能力?
问题需要跨文档检索、解析复杂文档、分析推理,以及部分问题需要视觉理解(7%)和网络搜索(10%)。
OfficeQA Pro V2是如何构建的?
它使用Databricks内部的asynth库构建合成数据生成流程,自动化生成和验证问题,相比原始OfficeQA的手动构建更高效、可扩展。
OfficeQA Pro V2的发布对企业和研究者有什么意义?
它可作为测试集,帮助企业开发者比较模型和代理架构,识别失败环节(解析、检索、推理等),并衡量系统改进对准确率、延迟和成本的影响。研究者可评估自己的系统,推动企业AI代理发展。