在自然语言理解和翻译领域,Facebook 与 Deepmind Technologies、纽约大学(NYU)和华盛顿大学(UW)合作推出了一个名为 SuperGLUE 的新基准。这一基准旨在应对更复杂的任务,推动自然语言处理技术的进步。
近年来,Facebook 在自然语言处理(NLP)领域取得了显著进展。利用半监督和自监督学习技术,Facebook 利用未标记的数据提升了系统的性能。在第四届机器翻译大会(WMT19)上,Facebook 使用一种新型的半监督训练方法,在多种语言翻译任务中取得了第一名的成绩。此外,Facebook 还引入了一种新的自监督预训练方法——RoBERTa,该方法在多项自然语言理解任务中超过了所有现有的 NLP 系统。
NLU 系统的发展迅速,以至于现有的许多基准已经无法满足进一步的技术提升需求。为此,Facebook 与合作伙伴共同开发了一套全新的基准、排行榜和 PyTorch 工具包,希望这些工具能够进一步推动 NLP 领域的研究进展。
对于神经机器翻译(NMT)模型,通常需要大量附有参考翻译的句子进行监督训练。然而,高质量的双语数据并不总是可用,这时就需要使用半监督学习技术,如反向翻译。Facebook 在 WMT19 比赛中使用反向翻译技术,成功提高了翻译质量。今年,Facebook 引入了一种新的方法,通过生成多个候选翻译并选择最能平衡正向、反向和流利性三个模型分数的翻译,进一步优化了反向翻译系统。
正向模型评估翻译在多大程度上捕捉了原句的意思,反向模型则评估翻译是否能准确重建原句,流利性模型则衡量翻译的流畅度。通过这三个维度的综合评估,系统可以生成优化后的翻译结果。经过几年的努力,Facebook 在英德翻译任务上的性能提高了 4.5 BLEU,这是一项显著的改进。根据人工评价,Facebook 的模型在英德、德英、英俄和俄英四个翻译任务中均排名第一。
Facebook 对自然语言处理领域的最大突破之一是 BERT,该方法展示了自监督训练技术的巨大潜力。Google 在 2018 年发布了 BERT,它具有与传统标签密集型监督方法相当甚至更优的能力。Facebook 应用 BERT 和相关方法,推进了对话型人工智能的研究,提高了低资源和无监督翻译的质量。
Facebook 引入了一种优化的 BERT 方法,称为 RoBERTa。RoBERTa 修改了 BERT 的关键超参数,包括删除了 BERT 的“下一个句子”预训练目标,并采用了更大的批量和学习率。与 BERT 相比,RoBERTa 的训练数据量增加了 10 倍以上。这种方法在通用语言理解评估(GLUE)和阅读理解考试(RACE)等基准测试中取得了最先进的结果。
GLUE 是一个衡量研究进展的行业标准,旨在涵盖广泛的 NLP 任务。在过去一年中,多个 NLP 模型(包括 RoBERTa)已经在 GLUE 基准测试中超过了人类。目前的模型展示了高效的多任务和迁移学习技术,使模型在特定任务上超越了人类水平。
为了进一步推动 NLP 研究,Facebook 与合作伙伴共同构建了 SuperGLUE,这是一个更高难度的基准,具有全面的人类基线。SuperGLUE 包括八个具有挑战性的任务,例如因果推理任务 COPA 和问答任务 BoolQ。这些任务旨在测试机器学习在样本有效性、迁移学习、多任务学习和自监督学习方面的创新能力。
SuperGLUE 包含了多个创新方法,用于测试一系列复杂的 NLP 任务。例如,COPA 任务要求系统从两个选项中选择一个符合因果关系的前提语句。RoBERTa 在多语言阅读理解任务 MultiRC 中的表现超过了所有现有的 NLU 系统,但仍与人类基线存在较大差距,这表明当前最先进的 NLU 系统仍有许多提升空间。
为了进一步推动人工智能系统的发展,Facebook 引入了首个长格式问答数据集和基准测试,要求机器提供长而复杂的答案。此外,Facebook 成立了人工智能语言研究联盟(AI Language Research Consortium),旨在促进 NLP 领域的合作研究。该联盟的成员有机会获得研究资助,参与年度研讨会,并参加重要的 NLP 会议。这些举措有望加速 NLP 社区的研究进展。
通过这些努力,Facebook 希望推动自然语言处理技术的发展,更好地连接世界各地的用户。