自然语言处理(NLP)被视为“人工智能皇冠上的明珠”,是计算机科学与人工智能领域的重要分支,拥有广泛的应用前景。自然语言理解和生成极具挑战,因为自然语言文本和对话在各个层次上都充满了歧义性和多义性。有效的词汇表示学习和信息抽取在这一过程中至关重要。
最近,中国科学院自动化研究所的自然语言处理团队在多模态词汇表示、大规模关系抽取、时间检测及事件识别方面取得了一系列进展。
相较于仅基于文本的模型,多模态模型能够更好地学习词汇表示。以往的多模态词汇表示模型对不同模态的信息一视同仁,但实际上,不同模态对不同类型词汇的影响程度有所不同。例如,“愉快”这类抽象词中,文本模态对词义的影响更大;而“桌子”这样的具体词中,文本和感知模态都会显著影响词汇含义。
基于此,自动化研究所的研究人员王少楠、张家俊、宗成庆等人提出了三种动态融合机制,分别为不同模态赋予不同的权重。他们还提出,利用相关或相似词对作为弱监督信号,可以让模型在学习词汇是否为相关词汇的过程中,自动调整不同模态的权重。测试结果表明,这种动态融合方法能大幅提升词汇表示质量。定性分析显示,该模型能够根据不同词汇类型分配不同的权重。
这项研究展示了计算模型在挖掘数据规律方面对于认知科学研究的帮助。
已有研究表明,多模态模型在词汇表示方面可以取得比单模态模型更好的效果。然而,“多模态词汇表示中到底编码了什么信息”、“它们在哪些方面超越单模态模型”,以及“不同模态的语义组合过程有何区别和联系”等问题尚待澄清。
鉴于多模态模型最初受到人脑概念表征的启发,研究人员假设通过人脑成分语义表征的相关性研究来回答这些问题。他们提出了一种简单的人脑成分语义表征相关性方法。通过与人脑成分语义表征的相关性分析,研究者调查了不同类型的词汇表示中包含的信息。研究发现,如果两个不同语义空间的间隔矩阵具有高相关性,则这两个空间的语义向量编码了相似的信息。然后,将计算模型得到的词汇语义表征映射到人脑的成分语义表征空间中,讨论组合模型如何组合不同类型的词汇属性。为了解释“不同类型的短语组合模型在组合词汇向量的过程中发生了什么”,研究者设计了一种映射方法,以便直观地比较不同类型的组合模型。
该研究探讨了自然语言理解中最基本的问题,即如何表征词汇含义以及如何将词汇含义组合形成更大的文本单元含义。这是一项结合最新认知心理学研究成果和自然语言处理任务的初步尝试。
关系抽取是自然语言处理领域的一项重要任务,旨在从文本句子中抽取关系实例,即关系及其对应的两个实体。传统的有监督关系抽取方法虽然效果良好,但需要大量人工标注的数据,难以扩展到大规模场景。近年来,一些学者提出使用弱监督方法,通过现有的大规模知识库对文本进行自动标注,从而更容易获得大规模的弱监督数据。弱监督数据以“包”为单位,一个实体对的“包”包含所有同时提及这两个实体的句子,其中存在噪声。弱监督数据中单个句子没有关系标签,但“包”有直接的关系标签。因此,传统的有监督模型无法直接应用于弱监督数据。
为了克服传统有监督方法在弱监督数据中应用的限制,自动化研究所的研究人员曾祥荣、何世柱、刘康、赵军等人提出了一种使用强化学习在弱监督数据中进行句子级关系抽取的方法。该方法首先对一个“包”中的所有句子进行关系抽取,然后根据“至少出现一次”的假设,用“包”中所有句子抽取的关系来预测“包”的关系。如果“包”中所有句子的关系都是NA关系,则预测“包”的关系为NA,否则预测为非NA关系类别中概率最大的那个。将“包”的预测结果与标注结果进行比较,得出奖励值,利用该奖励值对句子关系抽取器进行训练。实验表明,该方法可以有效提升句子关系抽取器的功能。与基线方法相比,该方法提高了13.36%的效果。
这项研究将强化学习引入关系抽取任务,为大规模关系抽取提供了新的思路,并在自然语言处理的开放关系抽取和事件抽取等领域具有巨大潜力。
事件检测和识别是信息抽取的重要任务,旨在从非结构化文本中检测事件触发词并识别其触发的事件类型。目前大多数方法只专注于从单一语言中提取线索,忽略了其他语言中包含的大量信息。这些单一语言方法中存在的数据稀缺性和单语言歧义问题,在一定程度上会影响事件的检测识别效果。综合利用多语言信息对单一语言方法进行改进和扩展,是降低这些内在问题影响的有效途径。
为了结合多语言信息进行事件检测与识别,自动化研究所的研究人员刘健、陈玉博、刘康、赵军等人开发了一种多语言方法——门控多语言注意力(GMLATT)框架,来解决上述问题。该方法采用上下文注意机制,利用多语言数据的一致性信息缓解数据稀缺问题;同时提出了跨语言的门控注意力机制,利用多语言数据包含的互补信息一定程度上缓解了单语言歧义问题。该框架首先通过机器翻译获得单语言数据的多语言平行语料,然后利用无监督方法学习双语数据的词汇对齐信息。在此基础上,每种单语言数据中应用注意力机制对单个句子的文本内容进行建模,不同词汇根据其指示性被赋予不同的权重,从而学习到更具表现力的语言特征。这些特征大大扩展了单语言线索,一定程度上缓解了数据稀缺问题。为了融合多语言线索,该框架通过门控多语言注意力机制对多语言置信度进行建模,每种语言都采用门控神经网络得到其置信权重。通过平衡多语言的组合系数,将多语言特征融合在一起。多语言融合特征中包含了多语言互补性信息,一定程度上缓解了单语言方法中的单语言歧义问题。该方法在ACE 2005数据集上进行了实验验证,结果表明这种方法优于当前的解决方案。
这项研究提出的门控多语言注意力框架为如何结合多语言信息辅助单一语言任务提供了新的思路,并且在自然语言处理的命名实体识别、实体关系消歧、实体关系抽取等任务中具有巨大的应用潜力。