
DeepAmbigQA:评估大模型回答完整性的歧义多跳基准

大型语言模型在开放域问答中经常无法给出完整的答案集,尤其是面对像“电影《Heat》中哪位演员获得过至少一项奥斯卡奖”这类问题,既需要区分同名电影,又需要对大量演员进行多跳推理。现有基准很少同时评估这两个挑战。
作者提出了一个自动数据生成管道 DEEPAMBIGQAGEN,基于文本语料和链接知识图谱生成自然且可验证的问题,系统性地嵌入了名称歧义和多步推理。基于该管道构建了 DEEPAMBIGQA 数据集,包含 3600 个问题,其中一半要求显式解析名称歧义。
实验结果显示,即使是最先进的 GPT-5,在歧义问题上的精确匹配率也仅为 0.13,在非歧义问题上的精确匹配率为 0.21。这些结果揭示了当前模型在处理复杂多跳推理和名称消歧时的严重不足,表明需要更鲁棒的问答系统来提升信息收集和答案完整性。


