内容提要
本文介绍了DEEPAMBIGQA数据集,用于评估大语言模型在开放域问答中处理歧义多跳问题的能力。该数据集包含3600个问题,其中一半涉及名称歧义消解。实验显示,即使先进的GPT-5模型在歧义问题上精确匹配率仅0.13,非歧义问题为0.21,表明现有系统在答案完整性上仍有不足,需更稳健的QA模型。
延伸解读
数据集设计亮点
DEEPAMBIGQA通过自动生成流程,将名称歧义与多跳推理结合,构造了3600个问题,其中一半明确要求消解歧义。这种设计弥补了现有基准的不足,能更真实地模拟开放域问答中的复杂场景,为评估模型的信息整合能力提供了新工具。
性能差距的启示
实验显示,即使先进的GPT-5在歧义问题上的精确匹配率仅为0.13,非歧义问题也只有0.21。这一显著差距表明,当前模型在处理需要区分同名实体并整合多步证据的问题时,答案完整性严重不足,亟需开发更稳健的问答系统。
对模型评估的参考价值
该数据集为评测大语言模型在信息收集和答案完整性方面的能力提供了新基准。研究者可借此识别模型在歧义消解和多跳推理上的具体短板,从而有针对性地改进模型架构或训练策略,推动开放域问答向更实用化方向发展。
Q&A
DEEPAMBIGQA数据集的主要目的是什么?
DEEPAMBIGQA数据集用于评估大语言模型在开放域问答中处理歧义多跳问题的能力,特别是答案的完整性。
DEEPAMBIGQA数据集包含多少个问题?其中多少涉及名称歧义?
该数据集包含3600个问题,其中一半(即1800个)涉及名称歧义消解。
DEEPAMBIGQA中的问题有什么特点?
问题需要多跳推理,并且一半问题明确要求解决名称歧义,例如区分同名电影。
在DEEPAMBIGQA上,GPT-5的表现如何?
GPT-5在歧义问题上的精确匹配率仅为0.13,在非歧义问题上为0.21,表明其答案完整性不足。
DEEPAMBIGQAGEN是什么?
DEEPAMBIGQAGEN是一个自动数据生成流水线,用于构建基于文本语料和知识图谱的问答任务,生成自然且可验证的问题,系统性地嵌入名称歧义和多步推理。
现有QA基准在评估LLM时存在什么不足?
现有基准很少同时评估名称歧义消解和多步推理,而DEEPAMBIGQA旨在联合评估这两个挑战。