现有模型还「不懂」自然言语:20多位研讨者谈NLP四大开放性成绩

图灵汇官网

在DeepMind主办的2018年Deep Learning Indaba深度学习峰会上,多位自然语言处理(NLP)领域的研究者接受了采访,分享了他们在NLP领域中的看法和见解。许多研究者认为自然语言理解(NLU)是当前NLP发展的最大挑战。

自然语言理解

自然语言理解被认为是NLP领域中最核心的问题。研究者们认为,为了实现真正的自然语言理解,我们需要构建能够像人类一样阅读和理解文本的系统。现有的模型大多只能提升文本匹配的能力,而不能真正理解文本的意义。

嵌入理解模块

在讨论如何构建接近自然语言理解的模型时,专家们提出了一些关键问题。其中一个关键议题是如何在模型中嵌入偏置项和结构。很多专家认为,模型需要学习常识知识。此外,对话系统和聊天机器人也是研究的重点。David Silver提出了一个不同的观点,他认为未来模型可能不需要嵌入理解模块,而是通过强化学习自主学习所有内容,包括算法、特征和预测。

程序合成

Omoju Miller提出了一种基于程序合成的方法,即利用高级规范自动学习程序。这种方法可以借鉴神经模块网络和神经编程器-解释器的思路。她还建议结合上世纪八九十年代的方法和框架,如FrameNet,以帮助推断对象的常识属性,如汽车是否是交通工具、汽车是否有把手等。

具身学习

Stephan Gouws认为,通过结构化的数据源和知识库(如Wikidata)中的信息,我们可以更好地学习语言。人类通过经验和互动,将周围环境的作用传递给身体,从而学习语言。然而,完全具身智能体所需的基础设施和计算能力非常庞大,因此逐步接近这一目标更为现实,如在模拟环境中进行语言学习、利用多模态数据等。

情感

Omoju认为,将人类情感等要素融入具身智能体非常困难。她建议可以考虑开发不具有人类情感但能够理解和帮助人类的系统。尽管基于传感器的情感识别系统和文本情感检测系统在不断进步,但要实现情感融合仍面临挑战。

认知和神经科学

研究者们还讨论了神经科学和认知科学在构建模型中的作用。Omoju推荐从认知科学理论中获取灵感,如皮亚杰和维果茨基的认知发展理论。她还鼓励跨学科研究,这引起了其他专家的共鸣。

低资源场景下的NLP

在低资源场景下,如低资源语言和方言,NLP面临的挑战依然存在。专家们讨论了如何在数据有限的情况下,开发适用于多种语言的通用NLP模型。Bernardt认为,语言之间存在共性,可以通过通用模型加以利用。然而,获取足够的数据和计算能力仍然是一个挑战。

对大型文本和多个文本进行推理

对大型文本和多个文本进行推理也是一个重要的研究课题。现有模型主要基于循环神经网络,但这些模型难以有效表征较长的文本。研究者们探讨了图启发式RNN工作流程的潜力,尽管目前只看到了有限的改进。同时,他们也讨论了如何通过提高模型的内存能力和终身学习能力来更好地表征语境和追踪相关信息。

数据集、任务和评估

最后,研究者们讨论了如何定义和评估任务。他们认为,正确的数据集和评估步骤对于衡量研究进展至关重要。Jade指出,非洲社会最亟待解决的NLP问题是资源匮乏问题。通过翻译和本地语言接触教育资源,可以帮助更多人受益。

以上内容是基于专家们的采访和讨论整理而成,旨在探讨NLP领域的几个主要开放性问题。

本文来源: 图灵汇 文章作者: 标贝科技