自然语言处理(NLP)是机器学习领域的一个分支,专注于使机器能够理解人类语言及相关文本。这是实现通用人工智能的关键挑战之一。
纽约大学、华盛顿大学、剑桥大学和Facebook AI将联合推出一个名为SuperGLUE的新评估基准,作为现有GLUE基准的升级版本。SuperGLUE旨在更好地反映未来NLP技术的发展趋势,难度显著增加,更具挑战性。
GLUE是一个通用语言理解评估基准,包含11项常见的NLP任务,涵盖自然语言推理、情感分析、阅读理解和语义相似性等多个领域。这些任务源自公认的高质量NLP数据集,最大语料库规模超过40万条记录,种类繁多。
尽管GLUE基准仅发布一年,已有许多NLP模型在特定任务中超越了人类基准,尤其是在QQP、MRPC和QNLI三个任务中:
当前,综合分数最高的模型是由微软提交的MT-DNN++模型,其次是阿里巴巴达摩院的ALICE Large模型和斯坦福大学的Snorkel MeTaL模型。从图表可以看出,得益于BERT和GPT模型的应用,大多数GLUE任务的得分已接近人类基准,只有少数任务仍存在较大差距。因此,开发新的评估基准显得十分必要。
SuperGLUE继承了GLUE的基本原则,为通用语言理解技术的进步提供了一个既具挑战性又实用的基准。在制定新基准的过程中,研究人员首先在NLP社区公开征集任务提案,最终选择了30个提案中的部分任务,并按照一定标准进行了筛选,包括任务本质、难度、可评估性、公开数据以及任务格式等。
在挑选任务时,研究人员首先审查了现有的GLUE任务集,去除了模型表现较好的9项任务,保留了表现最差的两项任务——Winograd格式挑战(WSC)和文本蕴含识别(RTE),因为它们仍有改进的空间。WSC和RTE分别属于自然语言推理和阅读理解范畴,人类通常能轻松应对这类任务,而NLP模型的表现则较差。此外,研究人员还新增了5项任务,分别是CB、COPA、GAP、MultiRC和WiC,这些任务主要测试模型的问答能力、指代消解能力和常识推理能力。
SuperGLUE的新任务更加注重测试模型在复杂文本下的推理能力。例如,WiC任务要求模型在两段文本中区分同一个单词的不同含义;CB和COPA任务则要求模型在给定前提的情况下,判断假设或理由的正确性。GAP任务要求模型根据文本中的词汇判断性别;MultiRC任务则要求模型完成阅读理解后回答问题。
研究人员测试了主流的NLP模型,发现最受欢迎的BERT模型表现勉强合格,但其综合分数仍比人类低约16.8%,这表明机器与人类基准之间仍有差距。SuperGLUE的难度确实比GLUE更大。
目前,SuperGLUE尚未正式推出,预计将在5月公布数据集和模型排行榜。在7月正式发布前,该基准可能会经历一些调整。尽管如此,SuperGLUE和GLUE之间的差异是可以接受的,新任务具有一定的挑战性,但仍可被全球NLP团队视为新的标杆。