基于深度学习的自然言语处理技术:边界在何方?

图灵汇官网

在当前的人工智能领域,人们通常会将人工智能分为三种类型:感知智能、运动智能和认知智能。感知智能主要涉及人脸识别、图像识别等技术,能够处理和识别外界信息。运动智能则集中在机器人操作机械臂等方面,能够根据输入信息作出相应动作。而认知智能则更侧重于理解和解决复杂问题,通过语言表达问题,制定长期规划并作出决策。

在这三种智能类型中,认知智能是最复杂的,也是人类独有的智能形式,它离不开自然语言处理技术的支持。近年来,基于深度学习的方法从根本上改变了自然语言处理技术的发展方向。这种方法将自然语言处理问题从传统的离散符号领域转移到连续数值领域,使问题定义和所使用的数学工具发生了根本性的变化,极大地推动了自然语言处理领域的进步。

在深度学习技术引入之前,自然语言处理所使用的数学工具与其他领域(如语音、图像、视频处理)的数学工具截然不同,这导致了不同模态之间信息交流的障碍。然而,随着深度学习的应用,自然语言处理和其他领域(如语音、图像、视频处理)共享了相同的数学工具,从而消除了这些障碍,实现了多模态信息的有效处理和融合。因此,自然语言处理技术取得了前所未有的进展,应用范围也得到了显著扩展。

尽管基于深度学习的自然语言处理技术取得了巨大成功,但也暴露出一些局限性:

  1. 当前的自然语言处理主要依赖于数据驱动的方法,但这些方法只能理解符号之间的关系,而不能理解符号与现实世界的联系。例如,机器可以理解“我饿了”和“需要吃饭”这两个句子之间的关系,但却不能像人类那样理解这种需求背后的物理意义。
  2. 世界上有数千种语言,其中许多语言缺乏足够的数据支持。此外,在某些专业领域内,标注数据的匮乏也是一个严重的问题。大多数情况下,工业界面临的挑战往往缺乏标注数据,这意味着我们无法使用大量数据来训练系统。

刘群是华为诺亚方舟实验室语音和语义领域的首席科学家,他在中国科学技术大学获得学士学位,在中国科学院计算机技术研究所获得硕士学位,在北京大学获得博士学位。他曾担任中国科学院计算技术研究所的研究员、自然语言处理研究小组组长,并曾在爱尔兰都柏林城市大学担任计算机系终身教授,还曾是爱尔兰ADAPT研究中心自然语言处理主题负责人。

在2019年8月24日于北京举行的第四届语言与智能高峰论坛上,刘群详细阐述了深度学习在自然语言处理中的贡献及其局限性。他总结了近年来基于深度学习的方法在自然语言处理领域取得的成功,并列出了那些曾经被认为难以解决但现在已基本解决或接近解决的问题。同时,他也讨论了这种方法面临的挑战,分析了哪些挑战可以通过现有的深度学习框架解决,哪些挑战需要探索新的解决方案。

在过去十年中,自然语言处理领域最重要的进展之一就是引入了深度学习技术。深度学习解决了自然语言处理中的许多问题,但也留下了一些尚未解决的问题。刘群总结了这些问题,包括资源稀缺、可解释性、可信任性、可控性、超长文本处理和缺乏常识等,并探讨了这些问题与深度学习方法局限性的关系。

首先,关于“语义边界”或知识学习的问题,这是自然语言处理技术如何变得更加“深刻”的关键。虽然常识的理解对人类来说并不是问题,但对于机器来说却是一个巨大的挑战。例如,当我们告诉手机助手“查找附近的餐馆”时,手机会显示附近的餐馆位置。但如果只说“我饿了”,手机可能不会有任何反应,因为它缺乏“饿了需要吃饭”这样的常识。此外,许多常识隐藏在人们的认知深处,很难被总结出来并植入到系统中。

其次,关于“数据边界”或低资源问题。无监督学习、零样本学习、少样本学习、元学习和迁移学习等技术本质上都是为了应对低资源问题。面对缺乏标注数据的情况,例如小语种的机器翻译、特定领域的对话系统、客服系统和多轮问答系统等,自然语言处理尚未找到有效的解决方案。这类问题统称为低资源的自然语言处理问题。除了引入领域知识(如词典、规则)以增强数据能力外,还可以通过自动学习方法增加人工标注数据,或利用无监督和半监督方法利用未标注数据,甚至通过多任务学习利用其他任务或语言的信息,也可以使用迁移学习方法利用其他模型。

例如,在WMT2019生物医学机器翻译任务中,法语收录的医疗名词数据库中只有不到8万条语句,这对传统深度学习的数据训练量来说远远不够!

自然语言处理技术已经广泛应用在许多领域。二十年前,五笔输入法盛行,而拼音输入法则不受重视,主要原因在于自然语言处理技术未能很好地解决拼音转换汉字的问题。当时,用户输入一串拼音后需要手动选择每个汉字,而现在,借助先进的自然语言处理技术,用户输入拼音后只需选择几次就能得到满意的句子。此外,搜索引擎技术的进步也得益于自然语言处理的发展,现在输入一个问题就能直接得到推荐的答案,而不是一堆文章供用户自行查阅。

在多语言处理方面,RBMT(基于规则的机器翻译)时代,开发多语言机器翻译系统成本高昂,其中理想的中间语言方案因为系统过于复杂而难以实现。但在NMT(神经机器翻译)时代,单个多语言机器翻译系统被提出并验证有效,实现了中间语言的理想。

此外,2019年10月17日至19日,中国计算机学会将在苏州金鸡湖国际会议中心举办2019年中国计算机大会(CNCC 2019)。此次大会的主题为“智能+引领社会发展”,大会包括十五位国内外计算机领域知名专家和企业家的主题演讲、三场主题论坛、七十多场前沿技术论坛、二十场特色活动及一百个科技成果展览。其中三个大会论坛主要围绕互联网50年、工业互联网和深度学习三个主题展开讨论。七十多场技术论坛涵盖多个计算领域的热点主题,如人工智能、大数据、区块链、量子计算、神经形态计算、工业互联网、信息安全、健康医疗、教育教学等。刘群教授将担任“自然语言对话:技术挑战与行业应用”分论坛的主席,与社会各界分享自然语言处理技术的最新进展。

本文来源: 图灵汇 文章作者: 邻章