Databricks发布OfficeQA Pro V2基准,用于测试AI代理在企业级文档上的泛化推理能力。该基准基于美国财政部1793至2024年约12万页账目数据,含90个问题。前沿模型平均准确率仅37.5%,专用代理达41.1%,而Databricks Genie系统提升至60%。基准强调跨文档检索、解析和推理,仍具挑战性,旨在推动企业AI代理发展。
Databricks推出了OfficeQA基准,旨在评估AI代理在经济价值任务中的表现,特别是复杂数据集的推理能力。尽管现有模型在标准测试中表现良好,但在实际企业任务中的准确率仍低于70%。OfficeQA包含246个问题,分为简单和困难两类,反映企业常见问题。2026年春季将举行AI与人类团队的竞赛,以推动创新。
OfficeQA是由Mosaic研究团队于2025年12月4日推出的端到端基础推理基准测试,旨在评估和提升人工智能在实际应用中的推理能力。
完成下面两步后,将自动完成登录并继续当前操作。