2012年以来,自然语言处理进入了神经网络时代,至今已有七年。未来的发展方向是什么?让我们来看看ACL 2019主席、微软亚洲研究院副院长周明博士的观点。
7月12日至14日,2019第四届全球人工智能与机器人峰会(CCF-GAIR 2019)在深圳召开。此次峰会由中国计算机学会(CCF)主办,雷锋网和香港中文大学(深圳)承办,深圳市人工智能与机器人研究院校办支持。作为国内人工智能领域顶级盛会,峰会旨在打造一个跨界交流合作平台。
在CCF-GAIR 2019会议上,周明博士从自然语言处理(NLP)的概念、现有技术体系及未来发展方向等方面进行了深入解读。以下是主要内容:
大家下午好!今天非常荣幸参加CCF-GAIR大会,这个论坛非常有意义,讨论的是中国人工智能40年的纪念活动。
我从1985年开始从事机器翻译研究,至今已有30多年时间,经历了规则、统计和神经网络三个阶段。回顾过去,确实充满挑战,但大家充满热情,致力于将中国自然语言处理推向世界前沿。
中国的人工智能始于1979年,迄今已走过40年。过去40年,自然语言处理经历了从规则到统计再到神经网络的演变。现在可以说是自然语言处理的黄金时期,取得了许多突破性进展。然而,我们也注意到,神经网络在计算资源和数据依赖方面存在不少问题,特别是在建模、推理和解释方面仍有不足。因此,我们需要思考这种模式是否可持续,未来3到5年NLP该如何发展?
为解答这一问题,我将梳理神经网络自然语言处理的技术体系,探讨关键技术点及其不足之处,以及未来发展的方向。我认为,NLP未来的发展需要在计算、数据、技术、人才、合作和应用等多个方面实现长期协同进步。
什么是自然语言处理?自然语言处理是让计算机处理人类语言,使其具备听、说、读、写的能力,这是未来人工智能的关键部分之一。比尔·盖茨曾说过,自然语言处理是人工智能皇冠上的明珠,推动它的发展将极大促进科技进步。
自然语言处理的难度体现在诸多方面。例如,同样一组词在不同语境下可能有不同的含义。人类依靠常识和背景理解语义,但计算机只能依赖字面意思,因此常会出现误解。自然语言处理的历史可以追溯到计算机诞生初期,最早是基于规则的系统,后来发展为统计系统,如今则是神经网络系统。中国的自然语言处理起步并不晚,建国之初就有人开始研发俄汉机器翻译系统,后来又出现了英汉机器翻译系统。我有幸亲历了这一历程,从哈工大研究生时期起就从事机器翻译研究,直至今日。
中国自然语言处理的发展得益于改革开放,得益于各大公司和高校的合作,尤其是微软亚洲研究院与相关学校的紧密合作。同时,得益于包括CCF在内的各学会在NLP领域的深耕,举办各种学术会议和培训课程,促进了产学研合作。
人工智能的目标是让计算机拥有人类独有的智能,包括运算智能、感知智能、认知智能和创造智能。其中,自然语言处理被认为是认知智能的皇冠。近年来,由于数据增多、算法复杂化和计算能力提升,自然语言处理取得了显著进步。
微软在多个NLP任务上取得了重大突破,如聊天机器人、阅读理解、机器翻译和语法检查系统。自然语言处理的应用广泛,包括输入法、词典、翻译、手语翻译、语音助手等。
接下来,我们来看看神经网络自然语言处理的技术体系。首先是词的编码,即用多维向量表示词的语义。常用方法有CBOW和Skip-gram,通过大规模训练可以获得每个词的语义表示。接着,基于词的语义表示,可以生成句子的语义表示,通常通过RNN或CNN实现。此外,引入注意力机制和Transformer可以进一步提升性能。目前,预训练模型备受关注,如ELMo、BERT等,它们可以在少量标注数据的情况下取得较好的效果。
尽管自然语言处理在许多任务上的表现已经超越人类,但仍存在一些问题。例如,过度依赖计算资源和数据的问题,以及神经网络的不可解释性。未来,我们需要解决这些问题,推动自然语言处理向更加智能化的方向发展。
总的来说,未来自然语言处理的发展需要在计算、数据、技术、人才、合作和应用等方面共同努力,形成良好的生态系统,从而实现更加智能化的应用。
希望这些内容对你有所帮助。