自然言语处理(NLP)历史中的6个次要时期你知道吗?

图灵汇官网

自然语言处理(NLP)的发展历程可以分为六个阶段,这些阶段反映了该领域从早期探索到现代发展的演变过程。本文将简要介绍这六个阶段,并强调每个阶段的主要贡献和创新。

第一阶段:基础期(20世纪40年代和50年代)

自然语言处理的研究始于计算机科学的萌芽时期,受到图灵提出的计算模型的启发。在这个阶段,图灵的工作催生了多种计算模型,包括McCulloch-Pitts神经元,这是一种模仿人类神经元行为的模型。随后,史蒂芬·科尔·克莱尼的工作推动了有限自动机和正则表达式的应用,这些理论在计算语言学和计算机科学领域发挥了重要作用。

第二阶段:符号与随机方法(1957—1970)

自然语言处理的发展逐渐形成了两种主要的研究方法:符号方法和随机方法。符号方法强调语言结构和语法分析,而随机方法则侧重于利用概率来表示语言中的模糊性和不确定性。这两种方法各有千秋,共同推动了自然语言处理的进步。例如,Chomsky的工作通过有限自动机来描述语言结构,而Shannon的噪声通道模型则通过概率方法来恢复模糊的输入。

第三阶段:四种范式(1970—1983)

这一阶段,自然语言处理的研究呈现出多元化的趋势,主要由四种范式主导:

  1. 随机方法:在语音识别和解码方面,随机方法得到了广泛应用。马尔可夫模型被修正为隐马尔可夫模型(HMM),进一步提高了处理模糊性和不确定性的能力。在此期间,AT&T的贝尔实验室、IBM的托马斯·J·沃森研究中心和普林斯顿大学的国防分析研究所都做出了重要贡献。

  2. 符号方法:除了随机方法外,符号方法也取得了显著进展。自然语言处理在人工智能领域的应用日益广泛,早期的人工智能研究,如达特茅斯会议,推动了符号方法的发展。纽厄尔和西蒙的逻辑理论家系统和通用问题求解器系统等,都是这一时期的重要成果。

  3. 基于逻辑的系统:这些系统使用形式逻辑来表示语言处理中的计算。Colmerauer及其同事在转换语法方面的工作,Pereira和Warren在确定子句语法方面的工作,以及Kay在功能语法方面的工作,都为自然语言处理提供了新的视角。此外,威诺格拉德的SHRDLU系统展示了自然语言处理在高级解析中的潜力。

  4. 话语建模范式:格罗斯的工作强调了话语结构的重要性,她和同事研究了话语和话语焦点的子结构。西德纳引入了首语重复法,霍布斯等人也做出了贡献。

第四阶段:经验主义和有限状态模型(1983—1993)

20世纪80年代和90年代初期,有限状态模型等符号方法继续发展。同时,概率模型和数据驱动方法重新受到重视。IBM的Thomas J. Watson研究中心的工作推动了概率模型的应用,这些模型与数据驱动方法相结合,重点转向词性标注、解析和语义分析。此外,经验方法还带来了模型评估的新焦点。

第五阶段:融合期(1994—1999)

这一阶段,概率和数据驱动的方法成为自然语言处理研究的标准。这些方法融合了概率模型,并采用了从语音识别和信息检索中借鉴的评估方法。计算机速度和内存的快速增长使得这些技术能够在商业领域得到广泛应用,尤其是语音识别和信息检索等领域。

第六阶段:机器学习的崛起(2000—2008)

进入21世纪,大量可用的语言数据资源促进了自然语言处理的发展。例如,Penn Treebank等语料库提供了具有句法和语义信息的文本数据,这些资源为新系统的训练提供了宝贵的资源。监督机器学习成为了解决解析和语义分析等问题的重要手段。此外,无人监督的统计方法也开始重新受到关注,这些方法在机器翻译等领域得到了广泛应用。

本文摘自《人工智能》(第2版),作者为美国学者史蒂芬·卢奇和丹尼·科佩克。本书全面介绍了人工智能的历史、搜索方法、逻辑推理、知识表示、机器学习等多个主题,并提供了丰富的教学资源和学习素材。

本文来源: 图灵汇 文章作者: