CNCC2019将举办七十多场技术分论坛,其中刘群教授将担任“自然语言对话:技术挑战与行业应用”分论坛的主席,与各界人士分享自然语言处理领域的最新进展。
本文摘自DeepTech深科技。
当前的人工智能大致可分为感知智能、运动智能和认知智能。感知智能主要涉及人脸识别和图像识别等技术,能够识别外界信息;运动智能则关注机器人如何根据输入信息做出相应动作;而认知智能则更侧重于理解和解决复杂问题,通过语言表达问题,并制定长远计划和决策。
在这三种智能中,最复杂且具有人类特性的认知智能,离不开自然语言处理技术的支持。基于深度学习的方法彻底改变了自然语言处理技术的面貌,将自然语言处理问题的定义和求解从离散的符号领域转移到连续的数值领域,导致整个问题的定义和所使用的数学工具与以往大不相同,极大地推动了自然语言处理研究的进步。
在引入深度学习技术之前,自然语言处理使用的数学工具与语音、图像、视频处理使用的工具截然不同,这些不同形式的信息之间存在着巨大的障碍。而深度学习的应用,则将自然语言处理与语音、图像、视频处理所使用的数学工具统一起来,打破了这些不同形式信息之间的障碍,使得多模态信息的处理和融合成为可能。
总之,深度学习的应用使得自然语言处理达到了前所未有的水平,其应用范围也得到了极大扩展。
然而,尽管基于深度学习的自然语言处理取得了巨大成功,但也暴露出一些局限性:
大多数自然语言处理方法依赖数据驱动的方式,但实际上,目前的自然语言理解还不够深入。也就是说,机器实际上只是理解了符号之间的关系,而不是符号与真实物理世界的关系。我们的语言本质上是一种符号,现在的自然语言处理只能理解符号之间的关系,虽然可以通过大量数据驱动训练这种理解,但它并不能像人脑那样理解符号与现实世界的联系。
全球有数千种语言,其中许多语言并没有足够的数据资源。资源匮乏的问题比大多数人想象的要严重得多,尤其是在许多专业领域,缺乏足够的数据。工业界面临的大多数问题只有很少或者根本没有标注数据,无法提供大量数据来训练系统。
刘群是华为诺亚方舟实验室的语音语义首席科学家,拥有中国科学技术大学的本科学位、中国科学院计算机技术研究所的计算机硕士学位以及北京大学的计算机博士学位。他曾在中国科学院计算技术研究所担任研究员,领导自然语言处理研究小组,并在爱尔兰都柏林城市大学担任终身教授,还曾在爱尔兰ADAPT研究中心担任自然语言处理负责人。
在2019年8月24日在北京举行的第四届语言与智能高峰论坛上,刘群详细阐述了深度学习对自然语言处理的贡献与局限。他总结了近年来基于深度学习的方法在自然语言处理中取得的成功,并列出了那些过去被认为难以解决但现在基本已经解决或接近解决的问题。他还讨论了这种方法未来面临的挑战,分析了哪些挑战在当前深度学习框架下有望解决,哪些挑战在现有框架下难以解决,需要探索新的解决方案。
在过去十年中,自然语言处理领域最重要的发展之一就是引入了深度学习技术。深度学习解决了自然语言处理中的哪些问题?还有哪些问题尚未解决?
刘群总结了这些问题,包括资源稀缺问题、可解释性问题、可信性问题、可控性问题、超长文本问题和缺乏常识问题,并将它们与深度学习方法的局限性联系起来。
语义边界,即知识或常识的学习问题。虽然常识的理解对人类来说不是问题,但很难教给机器。例如,当我们对手机助手说“查找附近的餐馆”时,手机会在地图上显示附近餐馆的位置。但如果你说“我饿了”,手机可能不会有反应,因为它缺乏“饿了需要吃饭”的常识。除非手机设计师把这些常识编入系统,但这些常识大多隐藏在我们的认知深处,几乎不可能全部总结出来并编入系统。
数据边界,即低资源问题。无监督学习、零样本学习、少样本学习、元学习和迁移学习等技术本质上都是为了解决低资源问题。面对资源匮乏的情况,例如小语种的机器翻译、特定领域的对话系统、客户服务系统、多轮问答系统等,自然语言处理还没有有效的解决方案。这类问题被称为低资源自然语言处理问题。除了引入领域知识(词典、规则)以增强数据能力外,还可以利用自动学习的方法增加人工标注数据,采用无监督和半监督方法利用未标注数据,或者利用多任务学习方法利用其他任务甚至其他语言的信息,也可以采用迁移学习方法利用其他模型。这是自然语言处理技术如何变得更“广”的问题。
刘群教授举了一个WMT2019的例子,在收录法语医疗术语的数据库中,仅有不到8万条语句,这对传统的深度学习数据训练来说远远不够!
目前,自然语言处理技术在很多领域都有广泛应用。二十年前,五笔输入法流行,而拼音输入法受到冷遇,很大程度上是因为自然语言处理技术未能很好地解决拼音转换成汉字的问题。当时,编辑者输入一串拼音后,需要逐字选择,但现在,借助优秀的自然语言处理技术,输入一串拼音,通常只需选择几次就能打出满意的句子。此外,百度和谷歌的搜索技术,输入一个问题就能给出推荐的答案,而不会给你一堆文章让你自己去找,这些都是自然语言处理取得的重大进步,不断改善着我们的生活。
在多语言处理方面,RBMT(基于规则的机器翻译)时代开发多语言机器翻译系统的成本极高,尤其是中间语言(Interlingua)方案过于复杂,成为了“不可承受之重”。而在NMT(神经机器翻译)时代,单一的多语言机器翻译系统被提出并验证有效,中间语言的理想初步得以实现。
2019年10月17日至19日,2019年中国计算机大会(CNCC 2019)将在苏州金鸡湖国际会议中心举行,由中国计算机学会(CCF)主办,苏州工业园区管委会承办。今年大会的主题是“智能+引领社会发展(AI+ Leading the Development of Society)”,包含十五位国内外计算机领域知名专家、企业家的大会报告、三场大会主题论坛、七十多场前沿技术论坛、二十场特色活动以及一百个科技成果展。
其中三个大会论坛主要围绕互联网50周年、工业互联网和深度学习三个主题展开讨论。七十多场技术论坛涵盖多个计算领域的热点主题,如人工智能、大数据、区块链、量子计算、神经形态计算、工业互联网、信息安全、健康医疗、教育教学等。刘群教授将担任“自然语言对话:技术挑战与行业应用”分论坛的主席,与各界分享自然语言处理技术的最新进展。