现有模型还「不懂」自然言语:20多位研讨者谈NLP四大开放性成绩

图灵汇官网

在2018年的Deep Learning Indaba会议上,多位自然语言处理(NLP)领域的研究者接受了采访,分享了他们对NLP领域现状、挑战和未来发展的看法。

许多研究者认为,自然语言理解(NLU)是NLP面临的最大挑战。当前的模型虽然在某些方面取得了进展,但尚未实现真正的自然语言理解。研究者们普遍认为,要构建能够像人类一样理解和处理文本的系统,必须解决自然语言理解的问题。

偏差与学习

一个关键问题是如何在模型中引入偏差,使之更接近自然语言理解。部分专家认为,模型需要具备常识,而另一些专家则强调对话系统的必要性。对于强化学习,David Silver提出了一个极端的观点,即模型应该自学所有内容,包括算法、特征和预测。然而,多数专家支持在模型中嵌入理解模块的想法。

程序合成

Omoju Miller提出,从程序合成中获取灵感可能会有助于解决NLU问题。她建议结合传统方法和现代统计方法,以更好地理解对象的常识属性,如汽车是否是交通工具、是否有把手等。

具身学习

Stephan Gouws提出,人类通过与环境的互动学习语言,因此在构建NLU模型时可以借鉴这种方法。不过,创建这样的环境需要大量的计算资源。尽管如此,研究者们认为可以通过模拟环境和其他方法逐步接近目标。

情感

Omoju认为将情感因素融入NLU模型非常困难。她建议寻找不需要真实情感但能理解人类情感的解决方案。虽然情感识别系统正在不断进步,但仍有许多挑战需要克服。

认知与神经科学

专家们还讨论了认知科学和神经科学在NLP中的应用。Omoju建议研究者从认知科学理论中汲取灵感,如皮亚杰和维果茨基的认知发展理论。这有助于构建更加智能化的模型。

低资源场景下的NLP

另一个重要的议题是在低资源场景下进行NLP研究。专家们讨论了是否需要针对特定语言开发专门的NLP工具,或者继续进行通用NLP研究。通用模型的挑战在于如何获取足够的数据和计算资源。低资源语言的模型在样本效率方面表现不佳,但跨语言词嵌入技术已经取得了一定进展。

对大型文本和多个文本进行推理

研究者们还探讨了如何高效处理大规模文本。现有的循环神经网络(RNN)难以处理长文本,而受图启发的RNN可能是一个可行的方向。此外,OpenAI Five的研究表明,增加数据量和计算资源可以显著提高模型性能。

数据集、任务和评估

最后,专家们讨论了如何定义和评估NLP任务。他们认为,正确定义任务和构建合适的基准数据集是至关重要的。当前的基准测试和评价设置存在一些问题,但总体而言,解决资源匮乏问题是NLP研究中最紧迫的任务之一。让人们能够通过翻译接触到各种教育资源,是实现这一目标的关键步骤。

本文来源: 图灵汇 文章作者: 彭珊
    下一篇