从统计视角看第二语言教学和自然语言处理的共同本质 ...

图灵汇官网

从统计视角探讨第二语言教学与自然语言处理的共通本质

宋飞 | 北京第二外国语学院汉语学院

摘要

尽管第二语言教学和自然语言处理在研究范式上有所不同,背后反映的是基于“规则”与基于“统计”的不同研究思路。自然语言处理逐渐从偏重“规则”转向重视“统计”,这对第二语言教学的发展具有重要的启示意义。从统计角度来看,无论是解决人类还是计算机学习语言的问题,第二语言教学和自然语言处理的研究思路本质上应是相通的。自然语言处理利用统计语言模型来模拟人在语言学习和使用中的认知特点,而基于统计的自然语言处理实践有助于揭示语言教学的规律,即不应高估语法在语言学习中的作用,要使学习者建立正确的语言模型,必须依靠大量的规范语料进行训练。


引言

第二语言教学和自然语言处理都是研究语言的学科,在某些高校中,这两个领域通常被划归为语言学及应用语言学的专业方向。通俗地说,它们的任务类似:第二语言教学关注如何更好地教人掌握一门语言,而自然语言处理则研究如何更好地教会计算机掌握一门语言。然而,长期以来,这两个学科领域之间的交流并不充分。其中一个原因是,第二语言教学领域的研究者多来自语言学专业,采用文科的研究范式,而自然语言处理领域的研究者多来自计算机相关专业,采用理科的研究范式。因此,两个领域的研究者在研究语言的基本思路上往往不同,第二语言教学多强调“规则”,而自然语言处理则特别重视“统计”。

规则与统计的差异

基于规则和基于统计的语言研究各有其合理性。基于规则的语言研究依赖于语法规则体系的建立,语法规则是发现和理解语言规律的工具和基础。第二语言教学常常将语法教学视为重点,这似乎是顺理成章的事。而基于统计的语言研究则更加重视数据和数学建模的作用,因为计算机不会受到生命长度和记忆容量的限制。基于统计的语言研究倾向于相信“一切规则源于语料”,通过丰富的语料数据训练语言模型,而不是人为构造一个语法规则体系。

规则的困境

(一)共同问题

在第二语言教学中,教师通常会以教材课文为纲,提取其中的“语法点”,并逐一讲解。学生则记录这些语法规则,试图构建完整的语法规则体系。然而,过分重视语法教学并不能很好地帮助学习者掌握一门语言。例如,许多人花费多年时间学习英语,却仍然无法听懂英文电影或与外国人交流。这表明以语法教学带动语言教学可能存在一些问题。

(二)问题的关键原因

要了解为何会出现上述问题,可以借鉴计算机是如何“掌握”一门语言的。例如,iPhone 中的 Siri 功能展示了计算机如何识别和理解自然语言,并用自然语言回答。这表明计算机在某种程度上“掌握”了语言,包括“听懂”、“理解”和“反馈”三个阶段。在语音识别的发展中,计算机科学家转变了研究思路,从基于规则转向基于统计,从而使语音识别率显著提升。这说明基于统计的语言研究在某些具体问题上的效果超过了基于规则的语言研究。

统计的共通性

(一)计算机的语言学习思维

计算机“掌握”语言的方法和途径更容易判断,因为计算机的所有输入和算法是可控和可统计的。研究者可以根据计算机的输出结果判断其对一门语言的“掌握”程度,并由此溯源产生这种结果的数据和机器学习方法。因此,如果计算机能够较好地“掌握”一门语言,其方法对于第二语言教学应当有较大的参考价值。

基于统计的自然语言处理通过大量真实、规范的语料来训练计算机语言模型的参数,进而建立一个语言模型。要判断一句话理解得或说得是否正确,就用其可能性(概率)来衡量。通过这种方法,计算机能够识别和理解自然语言。

(二)人类大脑的语言学习思维

人类学习语言的方式与计算机相似。人们通过大量的自然语料输入,在大脑中建立一个简化后的词频库和搭配库,并在需要时从中调取相应参数。这个假设意味着人类大脑中的语言模型是通过语料大数据训练得到的,而非通过掌握语法规则得到的。

结论

综上所述,从统计的视角看,第二语言教学和自然语言处理解决问题的思路和方法本质上是相通的。自然语言处理以统计语言模型模拟人在语言学习和使用中的认知特点,而基于统计的自然语言处理实践有助于揭示语言教学的规律。单纯依靠语法难以学好一门语言,必须依靠大量的语料数据输入。语法规则虽然表面上看起来能说服学生,但学生汉语水平的提高其实是语料训练潜移默化地起了作用。要想建立正确的语言模型,需要有大量规范的语料来训练模型参数。

本文来源: 图灵汇 文章作者: 新华社