NLP被英语统治?打破成见,英语不应是「自然言语」同义词

图灵汇官网

多资源语言与少资源语言

自然语言处理(NLP)领域的发展依赖于语言资源的存在,这些资源包括数字化的文本、音频材料和其他形式的语言数据,通常还会配有高级的标签或注释。这些数据对于NLP系统至关重要,因为它们反映了系统在实际应用中的预期输入。尽管无监督、弱监督、半监督或远程监督的机器学习技术减少了对标记数据的依赖,但仍然需要大量的标记数据来评估系统性能,还需要大量的未标记数据来支持需要大量数据的机器学习技术。

这导致了NLP领域中多资源语言和少资源语言之间的显著差距。多资源语言主要包括英语、汉语(普通话)、阿拉伯语和法语,这些语言有大量的可访问资源,包括大量的数字化文本、录音材料,以及各种语言工具,如解析器、形态分析器和命名实体识别器。相比之下,世界上大约7000种其他语言几乎没有资源,这使得这些语言被称为少资源语言。

截至2019年8月,LRE地图(LRE地图是欧洲语言资源协会ELRA的一项倡议,由与会作者为其论文所使用的或构建的语言资源进行登记而建)列出了961种英语资源和121种美式英语资源、216种德语资源、180种法语资源、130种西班牙语资源、103种汉语资源和103种日语资源。只有葡萄牙语、意大利语、荷兰语、标准阿拉伯语和捷克语等少数语言拥有超过50种资源。其他约7000种语言几乎没有资源。

这种情况的原因在于,许多研究主要集中在多资源语言上,特别是英语。尽管英语和汉语是使用最广泛的两种语言,但仅限于这两种语言的研究显然是不够的。NLP的应用范围非常广泛,包括生物医学应用、互联网上的机器翻译、语言学习等。然而,NLP的某些应用可能对弱势群体造成负面影响,因此需要更加谨慎地考虑这些应用的实际效果。

此外,即使是最基本的语言技术,如支持书写系统的键盘或拼写检查,也会对语言使用者的自尊和教育成果产生重要影响,并有助于保护地方语言。然而,NLP领域存在一个恶性循环,即对英语以外的语言的研究被认为是“特定语言”的研究,因此被认为不如英语研究重要。这种误解源于当研究的语言是英语时,往往不会明确声明这一点。

Bender Rule的历史

在2009年,Tim Baldwin和Valia Kordoni在EACL组织了一个研讨会,主题为“语言学和计算语言学之间的互动:道德的、罪恶的还是空泛的?”当时,NLP的机器学习技术非常流行,围绕这些技术的争论主要集中在如何使其更有效。一些争论声称,不编码特定语言知识的NLP系统是“语言无关的”。

在我2009年的EACL论文中,我反驳了这种观点,指出如果我们只研究英语或其他少数几种语言,我们无法判断构建的系统是否能在大多数语言中表现良好。过度拟合的反馈循环会导致我们寻找在英语测试中表现更好的系统。如果模型在英语中表现良好,并不意味着它能在所有语言中表现良好。应用语言学的知识,特别是语言类型学的研究成果,可以帮助构建更具普适性的系统。

在2011年的论文《关于在NLP中实现和评估语言无关性》中,我提出了一个“应做和不应做”的列表,其中包括了早期的观点,后来被称为Bender Rule:

即使是英语,也要预先声明所研究语言的名称。 这意味着,如果声明了特定数据是用于英语的,就会给研究工作披上语言无关的假象。

直到2019年,这一观点才真正受到重视。2018年11月,我在撰写一个用于计算语义学和语用学的语言资源时,感到再次受挫,因为即使是为英语提供语言资源的论文也未能清楚地说明英语是讨论和研究的对象。这促使我写下以下内容:

“自然语言”不是“英语”的同义词。

在2019年3月和5月,Nathan Schneider、Yuval Pinter、Robert Munro和Andrew Caines独立提出了“Bender Rule”或“Bender Clauses”,强调在研究中命名所使用的语言,质疑语言无关性的主张。最终,Bender Rule演变为“始终命名你正在研究的语言”。

英语既不是自然语言的同义词,也不是自然语言的代表

NLP是一个跨学科领域,建立在语言学、计算机科学、统计学和电子工程学的基础上。语言学家特别关注语言本身的现象,而不是特定语言行为所包含的信息或交流意图。例如,从事信息获取的人对通过数字化语言编码的信息感兴趣,而从事语言学研究的人则对语言的结构和形式及其与交流意图的关系感兴趣。

英语作为一种口语,而非手语,且有一个完善的、长期使用的基于电话的正字法系统。然而,其他语言,如西班牙语,有更透明的基于电话的正字法,还有一些语言只代表辅音(如传统的希伯来语和阿拉伯语),或有代表音节而不是单个声音的符号(如马拉雅拉姆语、韩语或日语假名),或使用语标系统(如中文)。许多语言不是书面的,或没有长期的书写传统或标准的正字法。因此,英语的NLP任务在其他语言中可能需要额外的处理步骤。

英语书写主要使用小写ASCII字符,且屈折词法相对较少,这与其他许多语言不同。英语的词序较为固定,但许多语言的词序更加灵活。英语的表单可能与数据库中的字段名和实体记录相匹配,这在其他语言中可能不常见。此外,英语有大量的训练数据,这在其他语言中可能难以获得。

命名语言只是第一步

很高兴看到这个领域已经开始讨论命名语言的问题,即使是对英语的研究。然而,随着NLP领域开始关注其工作中的道德影响,以及语言技术对用户和旁观者产生的负面影响,我们还需要进一步讨论用于训练和测试模型的数据。

首先,需要考虑语言内部的变化。所有语言都在不断变化,不同地区的语言差异很大。接受特定人群训练的模型不一定适用于其他人,即使使用同一种语言。

其次,基于文本的作者如何看待和讨论世界会影响模型的偏见。为了应对这些问题,Batya Friedman和我提出了“数据声明”,这是一种清晰记录NLP系统中使用数据集的做法。建议所有NLP系统附带关于训练数据的详细信息,包括具体语言种类、相关管理说明(数据如何选择及为何选择)、说话者和注释者的统计信息等。


希望以上内容能够满足您的需求。如果有任何进一步的要求或修改意见,请随时告知。

本文来源: 图灵汇 文章作者: 胡春霞