一文了解自然言语处理神经史(上)

图灵汇官网

NLP的发展历程概览

本文旨在总结NLP领域自2001年以来的重要里程碑,特别是那些与神经网络相关的进展。尽管无法涵盖所有细节,本文将重点介绍几个关键的发展阶段。

2001年 - 神经语言模型

语言建模是指在给定前文的情况下预测下一个词的任务。这一任务虽简单却具有实际应用价值,比如智能键盘和自动回复功能。早期的语言模型依赖于n-gram统计方法,通过平滑技术来处理未出现的n-gram组合。然而,Bengio等人在2001年提出了一种基于前馈神经网络的模型,这一模型被视为现代语言模型的开端。后来,递归神经网络(RNN)和长短时记忆网络(LSTM)逐渐取代了前馈神经网络,成为语言建模的主要手段。尽管如此,经典的LSTM仍然是一个强大的基准模型。如何利用这些模型更好地理解文本仍然是一个活跃的研究领域。

2008年 - 多任务学习

多任务学习是指在多个任务上训练模型,从而共享模型参数的方法。这一概念最早由Rich Caruana在1993年提出,并被应用于道路跟踪和疾病预测等领域。在NLP中,Collobert和Weston在2008年首次将多任务学习应用于神经网络,他们通过共享词嵌入来实现模型间的协作。这种方法不仅提高了模型的泛化能力,还促进了预训练词嵌入和卷积神经网络(CNN)的广泛应用。如今,多任务学习已成为NLP中的一个重要工具,被广泛用于提升模型性能。

2013年 - 词嵌入

传统的词袋模型由于缺乏上下文信息而受到限制。Mikolov等人在2013年提出的词嵌入技术,通过移动隐藏层和改进目标函数,使得大规模训练成为可能。这些词嵌入不仅能捕捉词与词之间的关系,还能在多种下游任务中发挥作用。尽管词嵌入技术经历了多次迭代,word2vec依然是目前广泛使用的技术之一。此外,词嵌入还可以扩展到更高层次的任务,例如句子表示和跨语言转移学习,为低资源语言和无监督机器翻译提供了新的可能性。

2013年 - 神经网络在NLP的应用

2013年和2014年是神经网络在NLP中广泛应用的转折点。递归神经网络(RNN)、卷积神经网络(CNN)和循环神经网络(LSTM)成为主流。RNN因其处理动态输入序列的能力而受到青睐,LSTM则因其更好的梯度稳定性而被广泛采用。CNN在文本处理中的应用也日益增多,因为它们比RNN更易于并行化。此外,递归神经网络(Recursive Neural Networks, RNN)基于语言的层次性特征,从下至上构建句子表示,进一步丰富了模型的表达能力。这些模型不仅可以根据局部语言信息学习词嵌入,还可以基于句法背景进行学习。

通过对这些关键发展阶段的回顾,我们可以更好地理解NLP领域的进步,并为未来的研究提供参考。

本文来源: 图灵汇 文章作者: 线性资本