带你片面看法自然言语处理三大特征抽取器(CNN/RNN/TF)

图灵汇官网

NLP 特征抽取器的演变:从 RNN 到 Transformer

在辞旧迎新的时刻,大家都在忙着回顾过去一年的成绩,或者直接把去年的计划复制粘贴到今年,以快速完成新年的计划。2018 年对于大多数人来说是充满挑战的一年,但在自然语言处理领域,这一年却取得了显著进展。其中,BERT 模型的出现尤为瞩目,成为了自然语言处理领域的热门话题。

BERT 模型的未来趋势

BERT 模型采用预训练和微调的两阶段方法,被认为是未来自然语言处理研究和应用的重要趋势。另一个值得关注的趋势是 Transformer 模型逐渐取代传统的 RNN,成为主要的特征抽取器。尽管这个观点在上一篇文章中已经提出,但本文将进一步提供支持这一结论的证据。

NLP 任务的特点及任务类型

NLP 任务与图像处理任务有很大不同。NLP 输入通常是句子或文章,具有以下特点:

  1. 一维线性序列:输入是按顺序排列的。
  2. 不定长:输入长度不固定,处理时需考虑这一特性。
  3. 相对位置重要性:单词或短语的位置变化会影响语义。

例如,“你欠我那一千万不用还了”和“我欠你那一千万不用还了”这两个句子,虽然只相差一个字,但语义完全不同。因此,捕捉长距离特征对于理解语义非常重要。

NLP 任务主要分为四类:

  1. 序列标注:如中文分词、词性标注等。
  2. 分类任务:如情感分析、文本分类等。
  3. 句子关系判断:如逻辑关系、问答等。
  4. 生成任务:如机器翻译、文本摘要等。

RNN 的现状与挑战

RNN 曾经是处理 NLP 任务的主要模型,特别是在 2014 至 2018 年间。然而,RNN 在处理长距离依赖时存在优化难题,LSTM 和 GRU 的引入解决了这一问题,但它们的并行计算能力较差,这限制了其在大规模并行计算中的应用。

RNN 改进方法

RNN 改进方法主要有两种思路:

  1. 保留所有时间步之间的连接:通过在隐层神经元之间并行计算,从而提升并行计算能力。
  2. 打断时间步之间的连接:通过部分打断连接,从而实现并行计算,但可能影响特征捕捉能力。

CNN 的发展与挑战

CNN 在 NLP 中的应用较晚,但近年来逐渐受到重视。早期的 CNN 模型在处理长距离特征方面存在不足,通过引入空洞卷积(Dilated Convolution)和增加网络深度,CNN 的性能得到了显著提升。此外,抛弃池化层,直接使用全卷积层,可以更好地保留位置信息。

Transformer 的崛起

Transformer 模型通过自注意力机制,可以高效处理长距离依赖问题。其核心组件包括多头自注意力层、残差连接和层归一化。Transformer 的并行计算能力使其在处理大规模数据时表现出色,特别是在机器翻译和语言理解任务中。

结论

总结来说,RNN 由于并行计算能力不足,逐渐失去主流地位;CNN 通过改进,逐渐提升了其处理长距离特征的能力;而 Transformer 则凭借其强大的并行计算能力和优秀的特征捕捉能力,成为当前最受欢迎的特征抽取器。未来,新的特征抽取器可能会出现,但目前来看,Transformer 的地位难以撼动。

希望本文能帮助你更好地理解 NLP 领域的特征抽取器的发展趋势和各自优势。

本文来源: 图灵汇 文章作者: