Facebook AI、DeepMind、纽约大学和华盛顿大学的研究人员共同发布了SuperGLUE平台,这是一个旨在评估人工智能(AI)自然语言处理(NLP)能力的新测试平台。随着越来越多的对话式AI系统在各类评测中接近极限,需要更高难度的挑战来进一步提升它们的NLP能力。
过去,涵盖多种NLP任务的GLUE评测平台推出不到一年,就已经有不少NLP模型超越了人类基准。研究者指出,通过AI社区的合作、NLP竞赛、各种评测平台的出现以及开源代码的推广,AI模型得到了迅速改进。特别是自GPT和BERT发布以来,GLUE上的模型性能大幅提升,甚至有些模型已经超过了人类水平。
然而,尽管这些模型能在特定任务上超越人类表现,但在处理某些人类能够轻松完成的任务时仍存在困难。因此,为了设定一个新的高标准,SuperGLUE应运而生。
SuperGLUE包括八项不同的任务,其中一项是“选择合理替代方案”(Choice of Plausible Alternatives, COPA),这是一项因果推理任务。系统会给出一个前提,然后需要从两个选项中判断因果关系。人类在这项任务中的准确率通常可达100%,而BERT则为74%。这表明AI模型仍有很大的提升空间。
以最近表现出色的RoBERTa模型为例,它在多项任务中击败了现有的所有NLU系统,并在“多句阅读理解”(Multisentence Reading Comprehension, MultiRC)任务上也超过了人类表现。然而,在SuperGLUE的各项任务测试中,RoBERTa的表现仍然不如人类,这说明即使是当前最先进的NLU系统,仍存在一定的局限性。
此外,研究人员还开发了首个针对长篇问答的数据集和评测,要求机器提供复杂的长篇答案。现有的问答系统大多局限于简短问题,如“水母有大脑吗?”而新的挑战则是希望机器能够理解更开放的问题,并提供更为深入的答案,比如“没有大脑的水母是如何运作的?”这将推动AI整合不同来源的信息,并准确回应这类开放式问题。