史上最大的实体关系抽取数据集!清华大学自然言语处理团队发布 FewRel

图灵汇官网

去年在EMNLP2018会议上,清华大学自然语言处理实验室在孙茂松教授的指导下发布了一个大规模精标注关系抽取数据集——FewRel。据称,这是当前最大的精标注关系抽取数据集。

该数据集包含100个类别,共计70,000个实例,远远超过了以往的同类精标注数据集。FewRel不仅适用于传统的监督和远监督关系抽取任务,而且在新兴的少次学习任务中也展现出极高的研究价值和广阔的应用前景。

团队还发表了题为《FewRel: A Large-Scale Supervised Few-Shot Relation Classification Dataset with State-of-the-Art Evaluation》的论文。该论文由清华大学自然语言处理实验室的博士生韩旭、姚远,本科生朱昊、于鹏飞、王子云共同完成。文章详细解释了FewRel数据集的设计原理,感兴趣的读者可以访问下面提供的链接阅读原文:

FewRel网站地址:https://thunlp.github.io/fewrel.html

论文地址:http://aclweb.org/anthology/D18-1514

关系抽取是自然语言处理中的一个重要任务,它通过从纯文本中提取实体间的关系,来构建和扩展知识图谱。例如,从句子“马云创办了阿里巴巴”中,可以抽取到“(马云,创始人,阿里巴巴)”这样的关系。关系抽取是获取知识的重要手段,对于理解和解析自然语言及世界知识具有重要意义。

然而,当前的关系抽取模型面临的一个主要问题是训练数据不足。相比计算机视觉领域的相关任务,自然语言处理的标注更为复杂,需要标注者具备专业知识。如表1所示,现有的精标注关系抽取数据集在关系数量和实例数量上都相对较少,这大大限制了关系抽取技术的发展。

表1:常用精标注关系抽取数据集对比

作为目前最大规模的精标注关系抽取数据集,FewRel包含100种关系,共计70,000个实例,是进行实验的理想选择。此前,加州大学圣巴巴拉分校计算机科学系助理教授王威廉与IBM合作的NAACL 2019论文《Sentence Embedding Alignment for Lifelong Relation Extraction》就使用了这个数据集。

FewRel以Wikipedia为语料库,以Wikidata为知识图谱构建而成。Wikipedia作为互联网上的自由百科全书,凭借其庞大的体量和丰富的知识内容受到自然语言处理学者的青睐。Wikidata则是Wikipedia中知识的结构化形式,目前包含超过5000万个实体和上千种关系。

清华大学自然语言处理实验室的数据团队首先利用这两者构建了一个远监督数据集。所谓远监督,即通过已有的知识图谱中的实体关系,推断出可能存在的关系,并自动标注文本。尽管这种方法可以生成大规模的标注数据,但数据中存在大量噪声,因此需要人工进行筛选和标注。最终,通过去除重复的实体对和不足1000个样本的类别,保留了122类,共122,000个实例。经过进一步的人工筛选,最终保留了100类,共70,000个高质量标注的实例。每个实例的平均长度为24.99,包含了124,577个不同的单词或符号。

FewRel的意义不仅在于提供了一个大规模的数据集。由于其包含的关系种类繁多,研究者可以在FewRel上进行多维度的探索,其中一个重要方向是少次学习(few-shot learning)。人类可以通过少量的例子学会新事物的认知,那么深度学习模型是否也能具备从少量样本中快速学习的能力呢?虽然计算机视觉领域已经有很多这方面的尝试,但在自然语言处理领域,尤其是在关系抽取方面,这种探索还很欠缺。由于以往的数据集关系数量和实例数量较少,而少次学习模型通常需要在大规模数据上进行预训练,并在多种类别的数据上进行采样测试,因此难以开展相关工作。

FewRel的出现为少例关系抽取打开了大门。如表2所示,FewRel与计算机视觉领域中的few-shot数据集mini-ImageNet具有相同的规模,表明其足以支持相关研究。

表2:FewRel与两个计算机视觉领域中的few-shot数据集对比

此外,FewRel还可以用于需要多种关系类别的研究,如终身学习(lifelong learning)。目前大多数关系抽取模型都是在预定义的类别范围内进行探索,而我们知道,世界知识是不断增长的,关系数量也不是固定的。如何使模型能够持续吸收新的训练样本而不忘记以前学到的知识,是一个值得深入研究的问题。相关实验需要大量的关系类别精标数据,而FewRel正好满足这一需求。

据透露,未来FewRel团队还将公开构建数据集时使用的基于Wikipedia的远监督数据。将远监督数据与精标数据结合,研究人员可以进一步研究远监督的降噪机制以及如何利用这两种数据进行半监督学习。

由于精标数据可以被视为“种子”,而远监督数据可以看作是巨大的语料库,FewRel还可以应用于主动学习(active learning)和自启动算法(bootstrapping)的研究中。然而,近年来在关系抽取领域,很少有人进行类似的探索,主要原因在于缺乏合适的数据集。随着FewRel的出现,相信这些重要方向的研究将会有所突破。

本文来源: 图灵汇 文章作者: 大飞机