20世纪,全球对自然语言处理的研究曾一度陷入误区。当时,学术界普遍认为,要让计算机实现翻译或语音识别等只有人类才能完成的任务,必须先让计算机理解自然语言,而这需要计算机具备类似人类的智能。(今天,几乎所有科学家都不再坚持这一观点,但许多外行人仍误以为计算机是依靠类似人类的智能解决了这些问题。)
为何会有这样的看法?因为人类就是这样做的,道理很简单。对人类来说,一个能够将英语翻译成汉语的人,必定能够很好地掌握这两种语言。这就是直觉的作用。在人工智能领域,尤其是自然语言处理领域,这种思维方式被称为“鸟类派”,即观察鸟类如何飞行,就可以模仿它们制造飞机,而不需要了解空气动力学。
实际上,莱特兄弟发明飞机依靠的是空气动力学而非仿生学。我们不应嘲笑前辈们那些源自直觉的想法,因为这是人类认知过程中的普遍现象。如今,机器翻译和语音识别已经相当成熟,并且有数亿人使用,但在这一领域的大部分人仍然错误地认为,这些应用是通过计算机理解自然语言实现的。事实上,这一切都是通过数学,更具体地说,是通过统计实现的。
在20世纪60年代,科学家面临的问题是如何理解自然语言。当时普遍的观点是,首先要做的是分析句子结构和获取语义。这实际上是惯性思维的结果:受到传统语言学研究的影响。学习外语时,都需要学习语法规则、词性和构词法等。当然,我们应该承认,这些规则是人类学习语言的好工具,而这些语法规则又很容易用计算机算法描述,这就更加坚定了人们基于规则的自然语言处理的信心。
相比之下,语义的研究和分析要混乱得多。语义比语法更难在计算机中表达,因此直到20世纪70年代,这方面的工作进展缓慢。由于语义对于理解和处理自然语言至关重要,各国政府在资助“句法分析”研究的同时,也投入了一部分资金用于语义分析和知识表示等领域。
例如:我们在中学和大学的英语考试中成绩很好,也不一定能考好GRE,更不用说看懂英文电影。原因在于,即使学习了10年的英语语法,也无法涵盖所有的英语用法。即使可以编写出涵盖所有自然语言现象的语法规则集,也很难用计算机解析。自然语言在演化过程中形成了词义和上下文相关的特性,因此其语法比一般的语法更为复杂。
在20世纪70年代,基于规则的句法分析(包括语法分析或语义分析)很快达到了瓶颈。从20世纪80年代末至今的25年里,随着计算能力和数据量的增加,过去看似无法通过统计模型解决的任务逐渐变得可行,包括复杂的句法分析。到20世纪90年代末期,通过统计方法得到的句法规则甚至比语言学家总结的更有说服力。
因此,今天自然语言处理的研究已不再局限于句法分析和语义理解,而是转向了更加实用的应用,如机器翻译、语音识别、文本到数据库自动生成、数据挖掘和知识获取等。
以上内容选自吴军的《数学之美》。文中如有理解不到位之处,请见谅。