自然言语的发展壮大必然性可以了解一下

图灵汇官网

贾里尼克是一位著名的自然语言处理专家,他年轻时经历了不少波折,但最终在康奈尔大学潜心研究信息论长达十年,最终揭示了自然语言处理的核心原理。1972年,他前往IBM沃森实验室进行学术休假,并在此期间指导了语音识别实验室的工作。两年后,他决定留在IBM,而不是回到康奈尔大学。

在IBM,贾里尼克组建了一支强大的研究团队,其中包括许多知名的研究人员,如他的合作伙伴波尔、语音识别公司Dragon的创始人贝克夫妇、最大熵迭代算法的发明者达拉·皮垂孪生兄弟、BCJR算法的共同提出者库克和拉维夫,以及首次提出统计机器翻译模型的布朗。这些研究人员中的许多人后来都成为了杰出的学者。

在20世纪70年代,IBM的氛围类似于20世纪90年代的微软和近10年的谷歌,科学家们可以自由地研究自己感兴趣的课题。在这种宽松的环境下,贾里尼克等人提出了统计语言识别的基本框架。在此之前,科学家们通常将语言识别视为通信问题,并利用两个隐藏的马尔可夫模型(声学模型和语言模型)来描述语音识别的过程。这一框架至今仍然对语音和语言处理产生深远的影响,不仅使语音识别变得实用,也为现代自然语言处理奠定了基础。贾里尼克因此被选为美国工程院院士,并被《技术》杂志评为20世纪100位发明家之一。

贾里尼克的前辈,如香农等人,在尝试将统计方法应用于自然语言处理时遇到了两个无法逾越的障碍:缺乏强大的计算能力和足够的文本语料库。他们最终不得不放弃了这一尝试。然而,在20世纪70年代的IBM,尽管计算能力不如现在,但已经足以开展一些研究。贾里尼克和他的同事们需要解决的问题是如何获取大量的文本数据。在今天看来,这是一个简单的问题,但在当时却颇具挑战,因为当时还没有互联网,大部分出版物也没有电子版本,即使有,也分散在不同的出版商手中,难以收集齐全。幸运的是,当时有一种通过全球电信网络连接在一起的业务——电传。IBM的科学家们正是通过电传业务的文本开始了自然语言处理的研究。

回顾历史,基于统计的自然语言处理方法在20世纪70年代由IBM奠定,是有其历史必然性的。首先,只有IBM具备足够的计算能力和数据资源。其次,贾里尼克已经在这一领域进行了十多年的研究,并且当时正在IBM工作。最后,20世纪70年代是小沃森带领IBM业务达到巅峰的时代。IBM对基础研究的投资力度很大,如果当时的年轻人能够认识到这几点,并具备良好的数学基础(这是当时贾里尼克等人选择科学家的重要条件),那么加入IBM将是明智的选择,未来的发展前景将会十分广阔。

摘自吴军《数学之美》,边学习边分享,如有不足敬请指正。

本文来源: 图灵汇 文章作者: 先进制造业