Databricks举办首届Grounded Reasoning Cup竞赛,11支学术团队在实时条件下测试AI代理对企业文档的推理能力。斯坦福以63.3%准确率夺冠,领先平均分约22个百分点。获胜策略包括文档预处理、定向检索、并行代理和验证步骤。但18.8%的问题无人解决,显示企业级推理仍有提升空间。
完成下面两步后,将自动完成登录并继续当前操作。