自然言语处理顶会NAACL最佳论文出炉!谷歌BERT获最佳长论文

图灵汇官网

【新智元导读】自然语言处理顶会NAACL近日公布了本年度的最佳论文名单。其中,谷歌的BERT论文获得了最佳长论文奖,可谓实至名归。

自然语言处理领域的四大顶会之一——NAACL 2019将于6月2日至7日在美国明尼阿波利斯市举行。据统计,此次会议共收到了1955篇论文,最终接收了424篇,接受率为22.6%,其中包括1198篇长论文和757篇短论文。

在会议期间,最佳论文奖项逐一揭晓,涵盖了最佳专题论文、最佳可解释NLP论文、最佳长论文、最佳短论文以及最佳资源论文等多个类别。谷歌的BERT论文荣获最佳长论文奖,这一成果充分体现了其在自然语言处理领域的卓越贡献。

最佳长论文:谷歌BERT模型

最佳长论文(Best Long Paper) - BERT: 预训练深度双向变压器以理解语言 - 作者:Jacob Devlin, Ming-Wei Chang, Kenton Lee 和 Kristina Toutanova - 链接:https://arxiv.org/abs/1810.04805

谷歌AI团队发布的BERT模型在多项自然语言处理任务中表现优异。在机器阅读理解任务SQuAD1.1中,BERT取得了超越人类水平的成绩。此外,它还在11项不同的自然语言处理测试中取得了最佳成绩,包括将GLUE基准提升至80.4%(相对提升了7.6%)和将MultiNLI的准确率提升至86.7%(相对提升了5.6%)。

自从BERT模型问世以来,基于BERT的各种改进模型不断刷新自然语言处理任务的成绩。可以说,BERT模型开创了自然语言处理的新时代。

BERT模型是一种新型的语言表示模型,它被称为“Transformer的双向编码器表示”。与现有的其他语言表示模型不同,BERT旨在通过结合所有层次的上下文来预先训练深度双向表示。因此,预训练的BERT表示可以通过添加额外的输入层进行微调,适用于多种任务,如问答任务和语言推理,而无需大幅修改模型结构。

论文作者指出,现有的技术严重限制了预训练表示的能力,主要原因是标准语言模型是单向的,导致可以使用的架构类型受限。为此,作者提出了一种新的预训练目标:遮盖语言模型(Masked Language Model, MLM),以克服单向性的限制。MLM通过随机遮盖模型输入中的某些token,使模型仅基于遮盖词的上下文来预测其原始词汇ID。这种目标允许表征融合左右两侧的上下文,从而预训练一个深度双向Transformer。

除了遮盖语言模型外,论文还引入了“下一句预测”任务,可以在预训练过程中共同训练文本对的表示。

最佳专题论文:减轻机器学习系统的偏见

最佳专题论文(Best Thematic Paper) - 题目: 名字中有什么?在没有受保护属性的情况下减少传记中的偏见 - 作者:Alexey Romanov, Maria DeArteaga, Hanna Wallach, Jennifer Chayes, Christian Borgs, Alexandra Chouldechova, Sahin Geyik, Krishnaram Kenthapadi, Anna Rumshisky 和 Adam Kalai - 链接:https://128.84.21.199/abs/1904.05233

越来越多的研究致力于减少机器学习系统中的偏见问题。然而,这些方法通常依赖于受保护属性(如种族、性别或年龄)的数据。这带来了两大挑战:一是这些属性可能无法获得,或者使用它们可能是非法的;二是通常需要同时考虑多个受保护属性及其交互效应。

在此背景下,研究团队提出了一种方法,用于减少个人职业预测概率与其名字的单词嵌入之间的相关性,而不需访问受保护属性。这种方法利用了词嵌入中编码的社会偏见,仅在训练阶段访问个人姓名即可实现。实验结果表明,该方法有效减少了种族和性别偏见,同时保持了分类器的整体准确性。

最佳可解释NLP论文:用量子物理框架建模人类语言

最佳可解释NLP论文(Best Explainable NLP Paper) - 题目: CNM:一个可解释的复值网络用于匹配 - 作者:Qiuchi Li, Benyou Wang 和 Massimo Melucci - 链接:https://128.84.21.199/abs/1904.05298

本文尝试使用量子物理的数学框架来建模人类语言。该框架利用了精心设计的量子物理公式,将不同的语言单元统一在一个复数向量空间中。例如,将单词视为量子态的粒子,将句子视为混合系统。研究团队构建了一个复数网络来实现该框架的语义匹配。由于其良好的约束复数组件,网络允许对具有明确物理意义的内容进行解释。提出的复数匹配网络(Complex-Valued Network for Matching, CNM)在两个基准问答数据集上的性能与强大的CNN和RNN基线模型相当。

最佳短论文:视觉模态在机器翻译中的作用

最佳短论文(Best Short Paper) - 题目: 多模态机器翻译中视觉模态的需求探析 - 作者:Ozan Caglayan, Pranava Madhyastha, Lucia Specia 和 Loïc Barrault - 链接:https://arxiv.org/abs/1903.08678

目前关于多模态机器翻译的研究表明,视觉模态要么是不必要的,要么只是辅助性的。然而,这种观点是在特定数据集(如Multi30K)中观察到的,这些数据集包含简单、短小且重复的语句,其中源文本被当作上下文呈现。在实际应用中,研究团队认为可以将视觉信息和文本信息结合起来进行翻译。实验结果显示,在有限的文本上下文中,多模态机器翻译模型确实能利用视觉输入生成更高质量的翻译结果,这与当前普遍观点相悖。

最佳资源论文:常识问答的新数据集

最佳资源论文(Best Resource Paper) - 题目: CommonsenseQA:面向常识性问答的新数据集挑战 - 作者:Alon Talmor, Jonathan Herzig, Nicholas Lourie 和 Jonathan Berant - 链接:https://arxiv.org/abs/1811.00937

在回答问题时,人们往往需要依靠丰富的常识知识,而不是特定的上下文。最近的研究大多集中在处理特定文件或背景的问题,很少涉及需要一般常识背景的任务。为了研究基于先验知识的问答任务,研究团队提出了CommonsenseQA,这是一个面向常识性问答的新数据集。该数据集通过从ConceptNet中提取与单个源概念具有相同语义关系的多个目标概念来生成问题。参与者需要撰写多项选择题,其中涉及源概念及其相关目标概念。此过程创建了12247个问题,并通过一系列强大的基线模型验证了数据集的难度。目前最好的基线模型基于BERT-large,准确率为56%,远低于人类的表现,后者达到了89%的准确率。

本文来源: 图灵汇 文章作者: 电博会CICE