自然语言理解(NLU)和语言翻译是众多关键应用的核心,包括大规模识别和删除有害内容,以及连接不同语言的全球用户。尽管近年来基于深度学习的方法显著加速了语言处理的进步,但在处理难以获取大量标记训练数据的任务时,现有系统仍存在局限性。
为此,Facebook 联合 Deepmind Technologies、纽约大学(NYU)和华盛顿大学(UW)共同开发了新的基准测试平台 SuperGLUE,并发布了相关介绍。以下是对这一进展的总结。
近期,Facebook 在自然语言处理(NLP)领域取得了重大突破。通过使用半监督和自监督学习技术,Facebook 利用未标记的数据提升了纯监督系统的性能。
在第四届机器翻译大会(WMT19)比赛中,Facebook 使用了一种新型的半监督训练方法,并在多种语言翻译任务中取得了优异成绩。此外,Facebook 还推出了一种新的自我监督预训练方法——RoBERTa,它在多项语言理解任务中超越了所有现有的 NLU 系统,甚至在某些情况下超过了人类基准,包括英德翻译和五个 NLU 基准。
NLU 系统的发展速度如此之快,以至于许多现有的基准已经达到了极限。为了推动技术进步,Facebook 与 Deepmind Technologies、纽约大学及华盛顿大学合作,开发了一套全新的基准、排行榜和 PyTorch 工具包。
神经机器翻译(NMT)模型通常需要大量附有参考翻译的句子进行有监督训练。然而,高质量的双语数据并非普遍存在,这促使研究人员利用单语数据进行训练。反向翻译是一种半监督学习技术,能够部分解决这一问题。
Facebook 最近在 WMT 上的报告基于其之前在大规模反向翻译方面的工作,这使得他们在去年的比赛中获得了第一名。今年,Facebook 引入了一种新的方法,通过生成多个候选翻译,并选择最能平衡正向、反向和流畅性三种不同模型分数的翻译,进一步改进反向翻译系统。
正向模型的分数主要通过候选翻译在多大程度上捕捉了原句意思来衡量;反向模型的分数则是通过查看模型从候选翻译中重建的句子准确性来判断;流畅性模型的分数则根据候选翻译的流畅性来衡量。系统通过对这三个分数的平衡,生成优化后的翻译结果。
通过几年的努力,Facebook 将英德翻译任务的性能提高了 4.5 BLEU,这是一个显著的进步。根据人工评估,Facebook 的模型在英德、德英、英俄和俄英四个翻译任务中排名第一。根据 WMT 的评分标准,Facebook 的英德翻译甚至优于人工翻译。
Facebook 对 NLP 领域的重大突破之一是 BERT 的优化和改进。BERT 由 Google 在 2018 年发布,展示了自监督训练技术的潜力,甚至在某些方面超越了传统标签密集型监督方法的功能。Facebook 使用 BERT 和相关方法推动对话型人工智能的研究,改进内容理解系统,提高低资源和无监督翻译的质量。
由于 Google 开源了 BERT,Facebook 进行了一项复制研究,并确定了进一步提高其有效性的设计变更。Facebook 引入了稳健优化的 BERT 预训练方法,即 RoBERTa,取得了新的最先进结果。
RoBERTa 修正了 BERT 中的关键超参数,包括删除 BERT 的“下一句预测”任务,并使用更大的批量和学习率进行训练。与 BERT 相比,RoBERTa 使用的数据量增加了十倍以上,因此训练时间也更长。这种方法在广泛使用的 NLP 基准测试 GLUE 和阅读理解考试 RACE 上产生了最先进的结果。
GLUE 是衡量 NLP 研究进展的行业标准,旨在涵盖广泛的 NLP 任务。在发布一年内,包括 RoBERTa 在内的多个 NLP 模型已经在 GLUE 基准测试中超过了人类水平。这些模型展示了大型文本数据集上的语言模型预训练与简单多任务和迁移学习技术结合的高效方法。
为了进一步推动 NLP 研究,Facebook 与 NYU、Deepmind 和 UW 合作开发了 SuperGLUE,这是一个具有全面人类基线的更高难度基准。SuperGLUE 包含了新的方法来测试一系列复杂的 NLP 任务,这些任务主要关注机器学习的创新,包括样本有效性、迁移、多任务和自监督学习。
SuperGLUE 紧随 GLUE 的步伐,提供单一的数字度量来总结不同的 NLP 任务集的进展。除了新的基准,Facebook 还发布了一个用于引导研究的排行榜和 PyTorch 工具包。
SuperGLUE 包含了八个具有挑战性的任务,其中包括选择合理的替代方案(COPA),这是一个因果推理任务。在 COPA 任务中,系统被赋予一个前提语句,并必须从两个选项中确定前提语句的因果关系。值得注意的是,人类在 COPA 上的准确率为 100%,而 BERT 只达到 74%,这表明 BERT 还有很大提升空间。
其他独特的前沿组件还包括用于测量模型偏见的诊断工具,如 winogender,用于测试自动指代消解系统是否存在性别偏见。SuperGLUE 还包括一个名为 BoolQ 的问答任务,每个示例由一段文字和一个关于这段文字的“是”或“否”的问题组成。
为了进一步推动人工智能系统的能力,Facebook 引入了第一个长格式问答数据集和基准测试,要求机器提供长而复杂的答案。当前的问答系统主要集中在一些简单的问题上,如水母是否有大脑。这项新的挑战要求机器对开放性问题进行深入解答,例如“没有大脑,水母如何工作?”现有的算法与人类表现仍有较大差距,这一新的挑战将促使人工智能系统整合来自不同来源的信息,为开放性问题提供复杂的答案。
此外,Facebook 还宣布成立人工智能语言研究联盟,这是一个由合作伙伴组成的社区,旨在共同推进 NLP 研究。成员有机会获得研究资金,参加年度研讨会,并参与重要的 NLP 会议。