SuperGLUE!自然言语处理模型新标准即将公布

图灵汇官网

自然语言处理(NLP)是机器学习领域的一个分支,专注于使机器能够理解人类语言及相关文本。这是实现通用人工智能的关键挑战之一。

纽约大学、华盛顿大学、剑桥大学和Facebook AI将联合推出一个名为SuperGLUE的新评估基准,作为现有GLUE基准的升级版本。SuperGLUE旨在更好地反映未来NLP技术的发展趋势,难度显著增加,更具挑战性。

GLUE是一个通用语言理解评估基准,包含11项常见的NLP任务,涵盖自然语言推理、情感分析、阅读理解和语义相似性等多个领域。这些任务源自公认的高质量NLP数据集,最大语料库规模超过40万条记录,种类繁多。

尽管GLUE基准仅发布一年,已有许多NLP模型在特定任务中超越了人类基准,尤其是在QQP、MRPC和QNLI三个任务中:

  • QQP任务基于Quora问题配对数据集,包含40万对问题,要求模型判断两个问题是否意思相同。
  • MRPC任务采用微软研究释义语料库,类似于QQP,要求模型判断两个不同表述的句子是否有相同的含义。
  • QNLI任务基于斯坦福问答数据集(SQuAD),主要考察模型的阅读理解能力,需要根据维基百科文章回答问题,答案可能出现在文章中或不在。

当前,综合分数最高的模型是由微软提交的MT-DNN++模型,其次是阿里巴巴达摩院的ALICE Large模型和斯坦福大学的Snorkel MeTaL模型。从图表可以看出,得益于BERT和GPT模型的应用,大多数GLUE任务的得分已接近人类基准,只有少数任务仍存在较大差距。因此,开发新的评估基准显得十分必要。

SuperGLUE继承了GLUE的基本原则,为通用语言理解技术的进步提供了一个既具挑战性又实用的基准。在制定新基准的过程中,研究人员首先在NLP社区公开征集任务提案,最终选择了30个提案中的部分任务,并按照一定标准进行了筛选,包括任务本质、难度、可评估性、公开数据以及任务格式等。

在挑选任务时,研究人员首先审查了现有的GLUE任务集,去除了模型表现较好的9项任务,保留了表现最差的两项任务——Winograd格式挑战(WSC)和文本蕴含识别(RTE),因为它们仍有改进的空间。WSC和RTE分别属于自然语言推理和阅读理解范畴,人类通常能轻松应对这类任务,而NLP模型的表现则较差。此外,研究人员还新增了5项任务,分别是CB、COPA、GAP、MultiRC和WiC,这些任务主要测试模型的问答能力、指代消解能力和常识推理能力。

SuperGLUE的新任务更加注重测试模型在复杂文本下的推理能力。例如,WiC任务要求模型在两段文本中区分同一个单词的不同含义;CB和COPA任务则要求模型在给定前提的情况下,判断假设或理由的正确性。GAP任务要求模型根据文本中的词汇判断性别;MultiRC任务则要求模型完成阅读理解后回答问题。

研究人员测试了主流的NLP模型,发现最受欢迎的BERT模型表现勉强合格,但其综合分数仍比人类低约16.8%,这表明机器与人类基准之间仍有差距。SuperGLUE的难度确实比GLUE更大。

目前,SuperGLUE尚未正式推出,预计将在5月公布数据集和模型排行榜。在7月正式发布前,该基准可能会经历一些调整。尽管如此,SuperGLUE和GLUE之间的差异是可以接受的,新任务具有一定的挑战性,但仍可被全球NLP团队视为新的标杆。

本文来源: 图灵汇 文章作者: 蓝鲸TMT