自然语言处理(NLP)领域涵盖了许多子领域,但许多子领域的技术仍未达到理想的效果。本文旨在跟踪NLP领域的研究进展,并简要介绍一些常见的NLP任务及其相关的数据集。作者Sebastian Ruder在文中详细介绍了传统的和核心的NLP任务,如依存句法分析和词性标注,同时也讨论了一些新兴的任务,如阅读理解和自然语言推理。本文的主要目的是为读者提供一份关于当前最佳研究和基准数据集的快速概览,以便他们能更好地开展未来的研究工作。
项目地址: https://github.com/sebastianruder/NLP-progress
参考博客: http://ruder.io/tracking-progress-nlp/
CCG超标记
分块
选区解析
指代消歧
依存解析
对话
领域适应
语言建模
机器翻译
多任务学习
命名实体识别
自然语言推理
词性标注
阅读理解
语义文本相似性
情感分析
情感解析
语义角色标注
自动摘要
文本分类
组合范畴语法(CCG)是一种高度词汇化的形式主义,Clark和Curran在2007年提出的标准解析模型使用了超过400个词汇语类(或超标记)。典型的解析器通常只包含大约50个词性标签。
CCGBank是一个CCG衍生语料库,从Penn Treebank中提取了依存结构。第2-21部分用于训练,第00部分用于开发,第23部分用于域内测试。评价模型基于准确率。
分块是一种解析的浅层方式,可以识别标记的连续跨度,形成合成单元(如名词短语或动词短语)。
Penn Treebank常用于评估分块。第15-18部分用于训练,第19部分用于开发,第20部分用于测试。评价模型基于F1分数。
选区解析的目的是从句子中提取基于选区的解析树,该句子根据短语结构语法表征其合成结构。
Penn Treebank的“华尔街日报”部分用于评估选区解析器。第22部分用于开发,第23部分用于测试。评价模型基于F1分数。
指代消歧是聚类文本中提及同一潜在现实世界实体的标记的任务。
实验基于《CoNLL-2012共享任务》的数据集,其使用了OntoNotes的共指注释。评价模型基于精度、召回率和F1分数。
依存解析是从表征其语法结构中提取依存解析,并定义标头词和词之间的关系,从而修正那些标头词。
Penn Treebank的Stanford依赖变换和预测词类标记用于评估依存解析。评价模型基于未标记依附分数(UAS)和标记依附分数(LAS)。
对话任务的评估一直是个难题,以前的方法已经使用了人类评价。
对于目标导向的对话,第二对话形状追踪挑战赛(DSTC2)的数据集是一个常用的评估数据集。模型基于单独的和结合的机会追踪的准确率进行评价。
多领域情感数据集(Multi-Domain Sentiment Dataset)是情感分析的领域适应常用评估数据集。评价模型基于准确率和对每个域取平均的分值。
语言建模是预测文本中下一个词的任务。
语言建模的常用评估数据集是Penn Treebank,曾经过Mikolov等人预处理。评价模型基于困惑度。
WikiText-2相对于Penn Treebank,其在语言建模中更接近实际应用。评价模型基于困惑度。
机器翻译是将句子从一种语言转换为另一种语言的任务。
模型在第九届统计机器翻译研讨会(VMT2014)的English-German数据集上进行评估(根据BLEU分数)。
模型在第九届统计机器翻译研讨会(VMT2014)的English-French数据集上进行评估(根据BLEU分数)。
多任务学习的目标是同时学习多个不同的任务,并最大化其中一个或所有任务的性能。
通用语言理解评价基准(GLUE)是用于评估和分析多种已有自然语言理解任务的模型性能的工具。评价模型基于在所有任务的平均准确率。
命名实体识别(NER)是在文本中以对应类型标记实体的任务。
CoNLL 2003任务包含来自Reuters RCV1语料库的新闻通讯文本,以四种不同的实体类型标注(PER、LOC、ORG、MISC)。评价模型基于F1分数。
自然语言推理是给定一个“前提”,确定一个“假设”为真(蕴涵)、假(矛盾)或者不确定(中性)的任务。
斯坦福自然语言推理(SNLI)语料库包含大约550k个假设/前提对。评价模型基于准确率。
多语型自然语言推理(MultiNLI)语料库包含大约433k个假设/前提对。评价模型基于准确率。
SciTail数据集包含27k个条目。评价模型基于准确率。
词性标注(POS tagging)是一种标注单词在文本中所属成分的任务。
Universal Dependencies(UD)是一个跨语言语法标注的框架,它包含超过60种语言的100多个treebanks。评价模型基于28种语言中的平均测试准确率。
用于词性标注的标准数据集是华尔街日报(WSJ)分配的Penn Treebank,它包含45个不同的词性标签。评价模型基于准确率。
问答是一种自动回答问题的任务。大多数当前的数据集都将该任务视为阅读理解,其中问题是从段落或文本中提出,而答案通常是文档中的文本片段。
AI2 Reasoning Challenge(ARC)是一个问答数据集,其中包含了7787个真实的小学程度的多项选择科学问题。评价模型基于准确率。
QAngaroo包含两个阅读理解数据集,它们需要结合多个文档的多个推理步骤。
RACE数据集是一个从中国初中和高中英语测试中收集的阅读理解数据集。评价模型基于准确率。
斯坦福问答数据集(SQuAD)是一个阅读理解数据集,它包含由众包基于维基文章提出的问题。回答为对应阅读短文的文本片段。SQuAD 2.0增加了不可回答的问题,难度高于SQuAD 1.1。
Story Cloze Test是一个用于故事理解的数据集,它提供了four-sentence形式的故事和两个可能的结局,系统将尝试选择正确的故事结局。
Winograd Schema Challenge是一个用于常识推理的数据集。评价模型基于准确率。
语义文本相似性在于推断两段文本之间的距离,例如我们可以分配1到5来表示文本有多么相似。相关任务包括释义转换和重复识别。
SentEval是一个用于评价句子表征的工具包,它包含17个下游任务,包括普通的语义文本相似性任务。评价模型基于皮尔森相关性。
Quora Question Pairs数据集包含400000对Quora问答,系统需要识别一个问题是否是另一个问题的副本。评价模型基于准确率。
情感分析是在给定文本下识别积极或消极情感的任务。
IMDb是一个包含50000条回复的二元情感分析数据集,回复都来自互联网电影数据库(IMDb),且标注为积极或消极两类。评价模型基于准确率。
Sentihood是一个用于细粒度情感分析的数据集,它旨在根据具体的方面识别情感。评价模型基于F1分数。
Stanford Sentiment Treebank包含215154条短语和11855条电影评论语句,都有细粒度的情感标注。评价模型基于准确率。
Yelp回复数据集包含超过500000条Yelp回复。它们同时有二元和细粒度(5个类别)级别的数据集。评价模型基于准确率。
情感解析是一种将自然语言转化为正式语义表征的任务。正式表征可以是SQL等可执行的语言,或更抽象的Abstract Meaning Representation(AMR)表征等。
WikiSQL数据集包含87673个问题样本、SQL查询语句和由26521张表中建立的数据库表。评价模型基于执行结果匹配的准确率。
语义角色标注旨在建模语句的述词论元结构,常常描述为回答“谁做了什么给谁”。BIO符号常用于语义角色标注。
模型通常基于F1分数的OntoNotes基准进行评价。
自动摘要是一种总结原文本语义为短文本的任务。
CNN/Daily Mail数据集包含带有多句摘要(平均3.75个句子或56个词)的再现新闻文章(平均781个词)。评价模型基于ROUGE-1、ROUGE-2和ROUGE-L分数。
文本分类是将句子或文本分配到合适的类别的任务。类别取决于选择的数据集,可以有不同的主题。
AG News语料库包含来自“AG's corpus of news articles”的新文章,在4个最大的类别上预训练。评价模型基于准确率。
DBpedia ontology数据集包含14个非堆叠类别的每一个的40000个训练样本和5000个测试样本。评价模型基于准确率。
TREC是一个用于问题分类的数据集,包含开放域、基于现实的问题,并被分成广泛的语义类别。评价模型基于准确率。
希望这些内容能帮助您更好地理解NLP领域的重要任务和相关数据集。如果您需要进一步的信息或有任何疑问,请随时联系我。