近年来,科技的进步极大地推动了人工智能的发展,而人工智能的下一个关键突破在于更好地理解自然语言。为了探讨这一议题,中国计算机学会于6月23日举办了一场名为“人机对话的产业应用与技术发展”的研讨会。在此次研讨会上,京东AI研究院常务副院长何晓冬博士发表了题为“自然语言理解技术突破”的主题演讲。
在这次演讲中,何晓冬博士首先简要回顾了深度学习技术在语音、语言和视觉等领域的作用。随后,他详细介绍了深度学习在自然语言处理(NLP)领域的前沿研究。他指出,当前的研究主要集中在两个方面:一是如何使AI通过NLP技术理解人类,例如理解意图、解析语义、识别情绪、搜索推荐等;二是如何使AI的结果易于被人类理解,如文本摘要、内容生成、话题展开、情感对话等。他还讨论了多模态智能、长文本生成、情感和风格表达以及人机对话等前沿方向的最新研究成果。
深度学习的前身——神经网络,在上世纪80年代曾一度流行。尽管在90年代人们对神经网络寄予厚望,但其在许多问题上的表现并不理想,尤其是在语音识别方面。直到2010年左右,深度神经网络模型才在大规模语音识别中取得显著进展。从那时起,神经网络在图像识别和机器翻译等领域也取得了巨大突破。
以语音识别为例,2000年以前,语音识别技术不断进步,错误率显著下降。然而,从2000年开始,语音识别进入了瓶颈期。直到2010年,Geoff Hinton与微软合作研发的深度学习技术使语音识别的错误率大幅下降。在重要的电话语音测试集Switchboard上,微软的语音识别错误率已降至5%左右,接近专业速记员的水平。
同样,在图像识别方面,深度学习也取得了显著进展。2012年,Hinton和他的学生首次提出了深度卷积神经网络,使得图像识别错误率大幅下降。2015年,孙剑团队提出的模型将图像识别错误率进一步降低至3.57%,表明计算机在某些任务上的表现已超过人类。
自然语言处理可以分为两大类:AI理解人类和AI以人类理解的方式表达。
AI理解人类主要通过以下几方面实现:槽值提取、意图分类、语义表征等。例如,通过深度学习技术,AI可以识别用户在搜索时的意图,并理解其背后的情感和需求。为此,何晓冬博士及其团队提出了深度解构语义模型(DSSM),该模型通过学习语义空间中的向量关系,使得AI能够更准确地理解语言背后的含义。
为了让AI能够以人类理解的方式表达,研究者们也在探索如何利用增强学习等技术生成内容。例如,通过增强学习,AI可以生成诗歌、摘要等文本内容,甚至可以进行跨模态的创作。此外,情感智能也是当前研究的重点之一。通过理解用户的情感需求,AI可以提供更加个性化的服务。
未来的突破方向主要包括多模态智能、复杂内容的创作、情感智能和多轮人机对话。其中,多模态智能旨在整合多种感知模式,使AI能够更好地理解复杂的知识;复杂内容的创作则致力于提升AI的创造力;情感智能则关注如何让AI更好地理解用户的情感需求;而多轮人机对话则旨在提高AI在对话中的交互能力。
何晓冬博士认为,自然语言理解技术的突破不仅仅是为了证明AI技术的先进性,更是为了实现AI帮助人类更好地连接世界的目标。通过不断推进自然语言处理技术,AI有望在更多领域发挥重要作用,推动人工智能向更高级的智能迈进。