复旦大学陈俊坤:自然言语处理中的多义务学习|AI 研习社职播间第 6 期

图灵汇官网

改写内容

近年来,深度学习在自然语言处理领域取得了显著进展,但在某些方面仍不及计算机视觉领域的突破明显。其中一个关键原因在于数据规模的问题。为了应对这一挑战,多任务学习成为一种有效的方法。多任务学习能够将多个任务合并在一起学习,充分利用任务间的关联性,从而提升每个任务的模型精度,进而减少每个任务所需的数据量。

近日,在雷锋网AI研习社的一次公开课上,复旦大学计算机系在读硕士陈俊坤分享了其研究小组在自然语言处理中多任务学习方面的最新成果。以下是分享的主要内容概述:

分享嘉宾

陈俊坤,复旦大学计算机系在读硕士,导师是邱锡鹏副教授,主要研究方向包括自然语言处理和多任务学习等。他的研究成果曾发表在AAAI、IJCAI等国际顶级会议上。

分享主题

自然语言处理中的多任务学习及复旦大学NLP实验室介绍

分享提纲

  1. 复旦大学NLP实验室介绍
  2. 基于深度学习的自然语言处理
  3. 深度学习在自然语言处理中的挑战
  4. 自然语言中的多任务学习
  5. 多任务基准平台

改写内容

本次分享有两个主要目标:一是介绍复旦大学NLP实验室的研究工作;二是帮助有意攻读研究生的同学了解国内实验室的情况,以便做出更加明智的选择。

复旦大学NLP实验室介绍

陈俊坤首先介绍了自己目前在复旦大学NLP实验室攻读硕士学位,并指导教师是邱锡鹏副教授。此外,他还提到自己在字节跳动AI实验室实习的经历,研究方向主要包括自然语言处理、多任务学习和迁移学习。此次分享将重点讨论多任务学习。

复旦大学NLP实验室致力于利用机器学习技术理解和解决人类语言问题,拥有一支国内领先的团队。实验室的研究方向涵盖了深度学习和自然语言处理的多个方面,如语言表示学习、词法分析、句法分析、文本推理和问答系统等。近年来,实验室发表了超过50篇国际顶级会议和期刊论文,并在ACL 2017上获得杰出论文奖。实验室还开发了开源自然语言处理系统,包括FudanNLP和fastNLP,以帮助解决实际问题。

自然语言处理简介

自然语言处理是一种旨在使机器能够理解和生成人类语言的技术。它的目标是实现从文本到机器的理解和从机器到文本的生成。自然语言处理的基本技术可以分为三个层次:基础技术、核心技术以及应用技术。其中,歧义性是自然语言处理的一大难点,尤其是在中文分词中更为明显。

自然语言处理的发展经历了几个阶段:最初基于规则的方法,后来引入统计学习方法,最后随着深度学习的兴起,基于深度学习的方法逐渐成为主流。自然语言处理是一个从理解到生成再到交互的过程。

基于深度学习的自然语言处理

基于深度学习的自然语言处理主要集中在如何在计算机中表示语言的语义。早期使用的是基于知识库的规则,而深度学习则采用了分布式表示方法。词嵌入(Word Embeddings)的概念从2013年开始流行起来,是自然语言处理中的重要组成部分。词嵌入使得计算机能够更好地理解和处理词语的意义。

在句子表示方面,由于句子的复杂性远大于单个词语,因此需要更加复杂的神经网络结构来表示句子。基于深度学习的自然语言处理可以分为四种主要类型:对象到序列、序列到类别、同步序列到序列、异步序列到序列。

深度学习在自然语言处理中的挑战

尽管深度学习在自然语言处理中取得了巨大进展,但仍面临一些挑战。与计算机视觉相比,自然语言处理的挑战更大。目前,解决这些问题的两种主要方法是无监督预训练和多任务学习。多任务学习能够通过共享参数来提高模型的泛化能力和鲁棒性,从而减少过拟合的风险。

自然语言处理中的多任务学习

多任务学习可以在一个共享模块中同时处理多个任务,例如词法分析、句法分析等。这种学习方式可以分为几种类型:跨领域任务、多级别任务、多语言任务和多模态任务。多任务学习通常采用三种形式:硬共享、软共享和共享-私有形式。

新的多任务基准平台

为了评估多任务学习的效果,出现了两个主流的基准平台:decanlp和GLUE。decanlp将多个任务整合在一起,而GLUE则专注于问答、情感分析等任务。这些平台提供了丰富的数据集,有助于推动自然语言处理技术的发展。

以上便是此次分享的主要内容。更多详情请参考视频回放,或者关注雷锋网AI研习社的公众号获取更多信息。

本文来源: 图灵汇 文章作者: 情感动物1981