近年来,深度学习技术在语音识别、图像分析和自然语言处理(NLP)领域得到了广泛应用。表示学习的核心目标是将研究对象的语义信息转化为低维稠密的实数向量。这类向量表示是一种分布式表示,单独查看向量中的每个维度没有明确的意义,但整体来看却能反映对象的语义信息。与传统的独热编码相比,表示学习的向量维度较低,这不仅提高了计算效率,还能充分利用对象间的语义信息,从而有效解决数据稀疏问题。因此,表示学习在单词、短语、实体、句子、文档及社会网络等领域得到了广泛研究。
在NLP中,文本表示是一项关键任务。最初,词袋模型是最常用的文本表示方法之一。随着深度神经网络的兴起,词嵌入(Word Embedding)方法逐渐流行起来,以解决词汇表过大带来的“维度爆炸”问题。词嵌入模型已经成为所有基于深度学习的NLP系统的重要组成部分,它们在固定长度的稠密向量中编码单词,从而显著提高了神经网络处理文本数据的能力。词向量可以通过基于统计的方法(如共现矩阵、SVD)或基于语言模型的方法来获得。2013年,Google团队发布了基于语言模型的词嵌入工具word2vec。其核心思想是通过词的上下文来获得词的向量化表示,包括CBOW和Skip-gram两种方法,以及负采样和层次softmax两种近似训练方法。word2vec的词向量可以很好地表达不同词之间的相似和类比关系,并广泛应用于NLP任务中。然而,由于word2vec的词向量是固定的,无法有效处理多义词问题,因此ELMO模型应运而生。ELMO模型从深层双向语言模型中学习词的表示,可以处理单词在不同语言环境中的变化,解决了多义词的问题。
在获取句子或文档的语义表示时,句子的语义由其各个部分的语义及其组合方式决定。因此,一些研究开始尝试根据输入的结构设计模型。例如,卷积神经网络(CNN)以n-gram为基本单位构建句子表示。递归神经网络(RNN)则根据输入的树结构构建句子表示。此外,长短时记忆网络(LSTM)及其变体也被证明是有效的句子级别表示方法。LSTM引入了一个近似线性的记忆单元来存储远距离的信息,以解决简单RNN的长期依赖问题。记忆单元的存储能力与其大小相关,增加记忆单元的大小会导致网络参数的增加。针对这一问题,注意力机制和外部记忆等改进方法被提出。注意力机制是近年来在NLP任务中广泛应用的有效技术,可以大大提高模型性能。进一步地,一种只基于注意力机制对序列进行表示的Transformer结构被提出。Transformer摒弃了传统结构,没有使用CNN或RNN的架构,而是通过综合考虑句子两个方向的信息,实现了良好的并行性,大大减少了训练时间。
许多自然语言特征表示方法和词表示方法采用两阶段的训练方法:首先在无标记数据上进行预训练,学习特征或词的表示;然后在标记数据上进行监督训练。word2vec和ELMO等方法常用于词向量的预训练。随着深度学习在表示学习领域的普及,以及Transformer等序列表示模型的发展,自然语言的表示学习已经从词和特征的层面扩展到了更大的粒度,如短语和句子。这些深度学习模型同样受益于两阶段的训练方法。ELMO之后,GPT模型采用Transformer进行编码,克服了ELMO使用LSTM带来的并行计算能力差的问题。BERT模型在采用Transformer进行编码的同时,双向综合地考虑上下文特征来预测词。与word2vec和ELMO不同,GPT和BERT在第一阶段预训练之后只需根据具体任务对模型结构进行微调,即可实现监督训练。BERT具有较强的普适性,几乎所有NLP任务都可以利用这种两阶段的训练思路,并取得显著的效果提升。
除了通用的NLP表示学习方法,自然语言处理还涉及许多需要深入研究的特性。例如,汉语具有部首共享和汉字共享的特点,即几个汉字共同的部首通常反映了它们之间的核心语义关联。RAFG模型基于部首感知和注意力机制,挖掘和应用这些特性,将这些特征系统地融入到中文文本分类任务中,从而实现更准确的中文文本语义表示。此外,图像信息可以增强句子的语义理解和表示。IEMLRN模型利用图像信息从不同粒度加强句子的语义理解和表示,实现了更准确的句子语义表示和句子对的语义关系分类。此外,语义表示技术的发展使得多媒体信息的有效建模和语义表示成为可能,为推荐和检索等实际应用场景提供了支持。近年来,多媒体共享平台快速发展,“弹幕”作为一种实时视频回复方式越来越流行。基于深度神经网络的弹幕语义表征方法通过对弹幕与视频情节之间的关联性进行表示学习,实现了对视频片段的标注,突破了传统视频推荐/检索系统只关注整段视频的局限性,满足了细粒度的需求。
自然语言的语义表示学习方法的发展为各种NLP任务带来了更多可能性。新型网络结构的出现使得我们能够获得更有效的语义表示。两阶段的预训练方法可以利用大量无标记文本,提取和表示通用语言学知识,从而提升下游NLP任务的效果。自然语言的语义表示学习取得了显著进展,但仍有许多领域值得进一步研究。无论是改进特征提取器还是引入大量数据中的语言学知识,都有助于实现更准确的语义表示。尽管目前许多NLP任务尚无法达到人类水平,但相信不断的研究和新技术的应用,将带来更加丰富的成果。