李航教授展望自然语言对话领域:现状与未来

图灵汇官网

改写后的文章

近日,李航教授在其博客中对自然语言对话领域的现状及最新进展进行了总结,并对未来的发展方向进行了展望。李航教授的文章内容详实,不仅注重整体格局和跨领域思维,还能从现实条件出发,提供富有启发性的见解。

引言

近年来,各种自然语言对话系统如雨后春笋般涌现,包括语音助手、智能客服、智能音箱和聊天机器人等。尽管对话系统的实用性不断提高,但当前技术仍存在诸多局限。计算机在与人类对话方面的能力究竟如何?自然语言对话面临哪些挑战?未来可能有哪些突破?需要重点研究和开发哪些技术?

李航教授曾与前同事在华为合作进行对话技术的研究,并参与华为 Mate10 语音助手的开发工作。本文基于他的研究与开发经验,尝试解答上述问题。

前提条件

功能主义

马尔(David Marr)提出的计算理论认为,计算可以分为功能层面、算法和表征层面、实现和物理层面。如果两个系统在功能层面表现相同,即使算法和物理层面不同,也可视为等效。这一理论同样适用于人脑和计算机。如果认为人的思维可以简化为计算,那么只要计算机在功能上能完成与人脑相同的任务,就能被视为具有同等智能。本文的对话系统讨论也将基于功能主义的观点。

合理行动的智能机器

人工智能是关于构建智能机器(或智能计算机)的科学与工程领域。智能机器可以分为两种:像人一样行动的机器和合理行动的机器。本文倾向于后者。合理行动的智能机器具备以下特点:与环境互动、目标导向、有明确的任务、有评价标准、功能上完成任务而非模仿人类、能力达到或超过人类。

构建合理行动的智能机器比构建像人一样行动的机器更为实际可行。当前大多数人工智能系统都属于这一类型。大数据和机器学习使这条路径更容易取得突破。李航教授在近期的一篇短文中详细探讨了合理行动的智能机器的相关问题。

图灵测试实际上针对的是像人一样行动的智能机器,但评估像人一样行动并不容易。如果目的是为人类提供智能工具,提高生活质量或工作效率,构建像人一样行动的机器并非必要。图灵测试作为人工智能的测试实验有其局限性。

因此,构建“合理行动”的对话系统应是我们未来的目标。无论是提供问答服务、帮助用户完成任务(如打开音箱、订机票)还是陪伴用户,都符合合理行动智能机器的特点。

自然语言对话

自然语言理解

自然语言理解有两种定义:基于表征和基于行为。基于表征的定义是指系统根据输入语言产生相应的内部表征;基于行为的定义是指系统根据输入语言采取相应行动。这两种定义在某种程度上是互补的。

从功能角度,自然语言理解过程包括词汇分析、句法分析、语义分析和语用分析。词汇分析将输入语句中的单词映射到其语义表征;句法分析根据句法规则判断单词之间的语法关系;语义分析基于单词和语法表征,根据系统中的世界知识构建语义表征;语用分析基于语义表征和上下文确定具体语义表征。

自然语言理解的核心是将一句话映射到系统的一个表征上。这种映射是多对多的,导致多义性和多样性。例如,“I saw a girl with a telescope”这句话有多种含义,而“distance between sun and earth”和“how far is sun from earth”两句话则有相同的含义。

语义分析是对语言字面意义的理解,可能有多种含义;语用分析则是在上下文中的语言理解。同样一句话在不同上下文中可能有不同含义。语言是一个极其复杂的现象,虽然从功能上可以在计算机上实现或接近语言理解,但仍有许多挑战。

人脑的语言理解机制

目前对人脑的语言处理机制了解有限,但有一些发现和假说。人的自然语言理解是一个非常复杂的过程,涉及大脑中的多个区域,包括布洛卡区和韦尼克区。这两个区域分别负责句法和词汇。人脑中的语言理解过程涉及视觉、听觉和运动等表象的模拟。例如,听到“Flying Pig”时,不同人会根据各自对飞和猪的概念组合出不同的表象。

语言对话与任务

对话是两个或更多人之间的交流,从功能主义角度看,对话的目的是共同完成信息交流的任务。多轮对话包含单轮对话,每一轮都需要理解对方的语言。例如,问候、问答、协作、说服、辩论等都可以视为任务。聊天也可以视为任务,目的是交流和沟通,整个过程可以分解为不同的子任务。

对话中要完成的任务可以用有限状态机表示,状态表示完成任务的一个阶段,目标状态代表任务完成。完成对话对应着从初始状态出发,通过一条路径到达目标状态。例如,订机票任务需要通过与对方交流提供相关信息,每个状态表示目前为止明确的信息。任务越复杂,状态数和模型复杂度越高。

现实中,对话任务的形式化仍有许多挑战,特别是在任务复杂且状态无法穷举的情况下。因此,对话系统通常局限于特定任务,称为任务驱动的对话,例如命令型和问答型对话。

当前技术

计算机实现与人同等的对话能力还很困难。当前的技术主要基于数据驱动和机器学习。对话技术分为单轮对话和多轮对话。

单轮对话

单轮对话有三种方法:基于分析、基于检索、基于生成。基于分析的方法将问题定义为分类和结构预测,适合命令型对话;基于检索的方法将问题定义为匹配,适合问答型对话;基于生成的方法将问题定义为文本转换或翻译,适合自动生成回答。

多轮对话

多轮对话系统主要用于特定领域的任务型对话,通常包含语言理解、语言生成、对话管理和知识库等模块。对话管理模块包括状态跟踪和动作选择子模块。多轮对话系统是基于分析的单轮对话的扩展,每轮对话中对发话进行语义理解,产生内部表征,对话管理使用有限状态机表示整个过程。

最新进展

近年来,深度学习和强化学习被成功应用于自然语言处理,包括对话。端到端训练和表征学习是深度学习的主要特点,强化学习适合于系统与环境互动的学习过程,多轮对话正是其应用之一。

一些最新的研究成果展示了深度学习和强化学习的应用。例如,Liang 等开发了神经符号机模型,可以从知识图谱中找到答案;吕等开发了神经查询器、符号查询器和连接查询器,用于自然语言的关系数据库查询;Peng 等提出了基于层次化深度强化学习的对话策略学习方法,帮助用户进行旅行安排。

未来展望

未来自然语言对话领域的重要研究课题包括:

  • 语义接地:将自然语言映射到内部表征,定义和使用语义表征是一个核心问题。
  • 多义性和多样性问题:尽管已有许多研究,但仍未彻底解决。
  • 符号表征和神经表征的结合:如何结合符号处理和深度学习是一个重要问题。
  • 多轮对话系统:如何基于深度强化学习进一步研究。
  • 对话系统的构建:如何构建复杂的对话系统并使其具有自动学习功能。
  • 小样本学习:如何在小样本条件下优化对话模型。

总结

本文总结了自然语言对话领域的现状及未来发展方向。从功能角度,计算机有望实现与人类似的自然语言对话,但目前这一命题无法证真或证伪。特定领域的对话实现已经可以看到,问题在于如何扩展到更多领域。

语言理解的核心是向内部表征的映射,多义性和多样性是主要挑战。要完成具体任务,定义和使用内部表征至关重要。基于分析的方法在特定场景下尤为重要,基于检索方法更适合单轮问答,基于生成的方法则适用于特定场景。

多轮对话需要体现完成任务的整个逻辑,有限状态机表示。开放式对话动态改变任务,目前技术条件下实现难度较大。在特定领域任务明确的条件下,对话是现实可行的。

近年来,深度学习和强化学习的应用使对话技术取得了显著进步。未来的发展方向应是结合符号表征和神经表征,推进深度学习和符号处理的融合。

本文来源: 图灵汇 文章作者: 智说财经