【自然言语生成】【发展史】概览

图灵汇官网

自然语言处理的发展经历了四个主要阶段:1956年以前的萌芽期、1957年至1970年的快速发展期、1971年至1993年的低谷期以及1994年至今的复苏与融合期。

  1. 萌芽期(1956年以前)

1956年以前,可以视为自然语言处理的基础研究阶段。人类文明经过数千年的发展,积累了大量数学、语言学和物理学的知识。这些知识不仅为计算机的诞生奠定了基础,也为自然语言处理提供了理论依据。同时,阿兰·图灵在1936年提出了“图灵机”的概念,这不仅推动了计算机的诞生,也为机器翻译和后续的自然语言处理提供了物质基础。

在此期间,由于机器翻译的社会需求,许多自然语言处理的基础研究也得以开展。例如,1948年香农将离散马尔可夫过程的概率模型应用于语言自动机的研究,并将热力学中的“熵”概念引入概率算法中。1952年,贝尔实验室开始了语音识别系统的研究。1956年,乔姆斯基提出了上下文无关语法,并将其应用于自然语言处理中。这些工作直接促成了基于规则和基于概率两种不同方法的产生,两者之间的争论持续了数十年。

此外,这一时期还有一些重要的研究成果。如1946年科恩进行了声谱研究,1952年贝尔实验室进行了语音识别系统研究。1956年,人工智能的诞生为自然语言处理打开了新的篇章。这些研究成果在后来的数十年中逐渐与其他技术相结合,丰富了自然语言处理的技术手段,拓宽了其应用范围。

  1. 快速发展期(1957年至1970年)

自然语言处理在这个时期迅速融入了人工智能的研究领域。由于存在基于规则和基于概率这两种不同的方法,自然语言处理的研究在这段时间内形成了两个主要阵营:基于规则的方法和基于概率的方法。

在这段时间里,两种方法都取得了显著进展。从20世纪50年代中期到60年代中期,以乔姆斯基为代表的符号派学者开始研究形式语言理论和生成语法,60年代末又开始了形式逻辑系统的研究。与此同时,随机派学者采用基于贝叶斯方法的统计学研究方法也取得了重大进展。然而,由于当时大多数学者更关注推理和逻辑问题,只有少数统计学和电子学背景的学者在研究基于概率的方法,因此基于规则的方法占据了主导地位。

这一时期的重要成果包括1959年宾夕法尼亚大学研发的TDAP系统以及布朗美国英语语料库的建立。1967年,美国心理学家奈塞提出了认知心理学的概念,直接将自然语言处理与人类认知联系起来。

  1. 低谷期(1971年至1993年)

随着研究的深入,人们发现基于自然语言处理的应用不能在短时间内取得突破性进展,新的问题不断涌现,许多人因此对自然语言处理的研究失去了信心。从70年代末开始,自然语言处理的研究进入了一个低谷期。

尽管如此,一些发达国家的研究人员仍然坚持不懈地进行研究。他们的努力使得自然语言处理在这一低谷期依然取得了一些成果。例如,70年代基于隐马尔可夫模型的统计方法在语音识别领域的成功应用。80年代初,话语分析也取得了重要进展。此后,自然语言处理研究者对过去的研究进行了反思,有限状态模型和经验主义研究方法也开始复兴。

  1. 复苏与融合期(1994年至今)

自90年代中期以来,计算机速度和存储容量大幅提升,为自然语言处理提供了更好的物质基础,使得语音和语言处理的商品化开发成为可能。同时,1994年互联网商业化及其相关技术的发展,使基于自然语言的信息检索和信息提取的需求变得更加迫切,自然语言处理的应用范围也更加广泛。

从90年代末到21世纪初,人们逐渐认识到,仅依靠基于规则的方法或基于统计的方法都无法成功实现自然语言处理。基于统计、基于实例和基于规则的语料库技术在这个时期得到了蓬勃发展,各种处理技术开始融合,自然语言处理的研究再次繁荣起来。

本文来源: 图灵汇 文章作者: 周杰昌