李航教授展望自然语言对话领域:现状与未来

图灵汇官网

引言

近年来,随着语音助手、智能客服、智能音箱和聊天机器人等自然语言对话系统的不断涌现,对话技术的应用逐渐普及。然而,尽管这些系统越来越实用,但技术本身的局限性依然明显。计算机究竟在多大程度上能自如地与人进行对话?自然语言对话面临哪些挑战?未来可能会出现哪些突破?我们需要关注哪些关键技术的发展?

笔者曾在华为从事对话技术的研究,并参与了华为Mate10语音助手的开发工作。本文基于这些经验和研究,尝试回答上述问题。

前提条件

功能主义

计算理论的奠基人之一大卫·马尔(David Marr)提出了计算的三个层面:功能层面、算法和表征层面、实现和物理层面。如果两个系统具有相同的输入和输出,它们在功能层面被认为是等价的。本文讨论对话系统时,也遵循这一功能主义的视角。

合理行动的智能机器

人工智能的目标是构建能够合理行动的智能机器。这类机器具备以下特点:系统与环境互动、目标导向、有评价标准、旨在功能上完成任务而不模仿人类、并且在某些方面的能力达到或超过人类。合理行动的智能机器相比模仿人类的机器更加实际可行,尤其是在当前对人脑工作原理尚不完全清楚的情况下。

因此,未来构建“合理行动”的对话系统应是我们追求的目标。这种系统可以为用户提供问答服务、帮助用户完成任务(如打开音箱、订机票),甚至成为用户的陪伴。

自然语言对话

自然语言理解

自然语言理解有两种不同的定义:基于表征和基于行为。基于表征的定义是指系统将输入语言转换为内部表征;基于行为的定义是指系统根据输入语言采取相应行动。两者在某种程度上是互补的。本文将从功能角度概述自然语言理解的过程,即输入是自然语言语句,输出是语句的语义表征,包括词汇分析、句法分析、语义分析和语用分析。

自然语言理解的核心在于将输入语句映射到系统内部的表征。这种映射是非唯一的,存在多义性和多样性。例如,“I saw a girl with a telescope”这句话可以有多种解释,而“distance between sun and earth”和“how far is sun from earth”则表达了相同的意思。

人脑的语言理解机制

人类的语言理解是一个复杂的过程,涉及大脑的多个区域。布洛卡区(Broca's area)和韦尼克区(Wernicke's area)在语言处理中起着关键作用。嵌入模拟假说(embodied simulation hypothesis)表明,人脑中的语言理解是基于视觉、听觉和运动等表象的模拟。例如,回答“大猩猩有没有鼻子?”这个问题时,我们会先在脑海中浮现出大猩猩的形象,然后据此作出回答。

语言对话与任务

对话是一种信息交流的过程,涉及多个参与者之间的互动。对话可以被视为一系列任务,如问候、问答、协作等。对话中的任务可以用有限状态机表示,状态表示完成任务的一个阶段。例如,订机票任务可以分为提供信息、确认信息等多个阶段。

对话系统需要对对方的发话进行理解,从而判断任务的完成情况。任务驱动的对话需要语义表征的支持。

当前技术

目前,对话技术主要依赖于数据驱动和机器学习。单轮对话可以分为基于分析、基于检索和基于生成的方法。多轮对话系统则通常包含语言理解、语言生成、对话管理和知识库等模块。对话管理使用有限状态机表示对话过程,逐步获取信息并完成任务。

最新进展

近年来,深度学习和强化学习在自然语言处理领域取得了显著进展。端到端训练和表征学习是深度学习的主要特点,使深度学习成为强大的工具。例如,神经符号机(Neural Symbolic Machines)可以从知识图谱中找到答案,而基于层次化深度强化学习的对话策略可以辅助用户进行旅行安排。

未来展望

未来自然语言对话的研究重点包括:

  • 如何更好地实现语义接地,即将自然语言映射到内部表征。
  • 解决语言理解中的多义性和多样性问题。
  • 结合符号表征和神经表征,实现深度学习和符号处理的结合。
  • 研究多轮对话系统,特别是在特定领域的应用。
  • 构建复杂系统,使其具备自动学习功能。
  • 在小样本条件下优化对话模型的学习效果。

总结

本文从功能主义角度探讨了计算机进行自然语言对话的可能性。虽然计算机在特定领域已经实现了类似人类的对话,但扩展到更广泛的领域仍面临挑战。语言理解的核心在于向内部表征的映射,多义性和多样性是主要挑战。未来的发展方向包括结合符号表征和神经表征,实现深度学习和符号处理的结合。

本文来源: 图灵汇 文章作者: plane中国