资源 |「火锅问答」是啥?面向自然语言和多步推理问题,新型问答数据集Hotpot ...

图灵汇官网

近日,来自斯坦福大学、卡内基梅隆大学和蒙特利尔大学的三名中国学生推出了一款新型问答数据集——HotpotQA。这一数据集旨在解决自然语言理解和多步推理问题。HotpotQA 数据集的设计初衷是为了挑战现有问答系统的多步推理能力。

项目参与者:

  • 杨植麟,卡内基梅隆大学在读博士生,研究方向为深度学习,导师为 Ruslan Salakhutdinov 教授和 William Cohen 教授。
  • 齐鹏,斯坦福大学在读博士生,研究方向为自然语言处理,导师为 Christopher Manning 教授。
  • 张赛峥,蒙特利尔大学在读博士生,研究方向为深度学习和自然语言处理,导师为 Yoshua Bengio 教授。

HotpotQA 数据集的作者撰写了一篇博客,详细介绍了这一数据集:

几个有趣的问题示例:

  • 你知道 Facebook 是在哪座城市诞生的吗?
  • 吃鸡和王者荣耀哪款游戏的玩家更多?
  • 如果你是个吃货,每天需要跑多久才能消耗掉十包辣条的热量?

这些问题乍看之下似乎有些复杂,但作为人类,回答起来其实并不困难。例如,要回答第一个问题,只需查找相关信息即可得知 Facebook 的创始人马克·扎克伯格是在哈佛大学的宿舍里创建了 Facebook,而哈佛大学位于美国马萨诸塞州的剑桥市。

数据集的特点:

HotpotQA 数据集具有以下几个关键特点:

  • 多步推理问题设计:所有问题都需要基于多步推理才能回答。研究人员使用亚马逊众包平台(Amazon Mechanical Turk)收集数据,确保每个问题都必须基于两个不同段落的信息才能解答。
  • 不受限于特定知识图谱:问题和答案均来自自然语言文本,不依赖于任何预设的知识图谱,因此更具多样性和实用性。
  • 提供细粒度的推理线索:除了问题和答案,还提供了回答每个问题所需的推理线索。这些线索有助于提高模型的可解释性,并允许模型在回答问题时展示其推理过程。

数据集的用途:

HotpotQA 数据集不仅包含了大量需要多步推理才能回答的问题,还引入了比较型问题(如“吃鸡 vs 王者荣耀”),这类问题是其他大规模问答数据集中较少见的。这些新类型的问题能够更好地测试机器在理解、对比和推理方面的能力。

应用场景:

HotpotQA 数据集对研究者来说是一个宝贵的资源,它不仅可以用来评估现有问答系统的性能,还可以作为开发新型多步推理问答系统的基准。HotpotQA 官网(https://hotpotqa.github.io/)提供了详细的介绍和下载链接。

论文详情:

论文《HOTPOTQA: A Dataset for Diverse, Explainable Multi-hop Question Answering》详细介绍了 HotpotQA 数据集的设计理念和应用前景。论文链接为:https://arxiv.org/pdf/1809.09600.pdf

总之,HotpotQA 数据集通过其独特的设计和丰富的数据类型,为机器多步推理问答的研究提供了重要的工具和资源。

本文来源: 图灵汇 文章作者: 杨婉倩