近年来,深度学习在自然语言处理领域取得了显著进展,但在某些方面仍不及计算机视觉领域的成就。其中一个重要原因是数据规模的问题。多任务学习通过共同训练多个任务,充分利用任务间的关联性,从而减少对大量训练数据的需求。
在近期的一次雷锋网 AI 研习社公开课上,复旦大学计算机系硕士研究生陈俊坤分享了其研究团队关于多任务学习在自然语言处理领域的最新成果。公开课的完整视频可在文末“阅读原文”处查看。
陈俊坤,复旦大学计算机系硕士研究生,导师为邱锡鹏副教授,主要研究方向为自然语言处理和多任务学习。其研究成果曾在 AAAI 和 IJCAI 等顶级会议上发表。
此次分享的主题是“自然语言处理中的多任务学习及复旦大学 NLP 实验室介绍”。
陈俊坤目前在复旦大学 NLP 实验室攻读硕士,导师是邱锡鹏副教授。他在字节跳动 AI Lab 实习,研究方向主要集中在自然语言处理、多任务学习和迁移学习。他将在本次分享中重点讨论多任务学习。
复旦大学 NLP 实验室致力于利用机器技术理解和解决人类语言问题,拥有一支国内领先的团队。实验室教师团队经验丰富,研究方向涵盖语言表示学习、词法/句法分析、文本推理、问答系统等多个领域。实验室近年来发表了50多篇国际顶级会议/期刊论文,并在ACL 2017上获得杰出论文奖。此外,实验室开发了多个开源自然语言处理系统,包括FudanNLP和fastNLP,旨在帮助公众解决更多实际问题。
自然语言处理的目标是让机器能够理解并生成自然语言。自然语言处理涉及语音识别、自然语言理解、自然语言生成、人机交互等环节,是人工智能和计算机科学的一个重要分支。自然语言处理的主要挑战之一是语言的歧义性,例如中文分词就是一个典型例子。
自然语言处理的发展经历了从基于规则的方法到统计学习方法,再到基于深度学习的方法。目前,基于深度学习的自然语言处理已经成为主流。
在计算机中表示语言语义的方法从早期的知识库规则发展到现在的分布式表示方法。词嵌入是自然语言处理中的一个重要概念,它从2013年开始逐渐流行。词嵌入之后,需要考虑句子表示,这比词嵌入更具挑战性。句子表示通常通过神经网络实现,通过这种方式可以将句子转化为向量形式。
自然语言处理任务可以大致分为四类: 1. 对象到序列:如文本生成、图像描述生成。 2. 序列到类别:如文本分类、情感分析。 3. 同步序列到序列:如中文分析、词性标注、语义角色标注。 4. 异步序列到序列:如机器翻译、自动摘要、对话系统。
相比于计算机视觉,深度学习在自然语言处理中面临更大的挑战。为解决这些问题,研究者们提出了两种有效的方法:无监督预训练和多任务学习。多任务学习之所以有效,是因为它能提供隐式的数据增强、更自然的表示学习、更好的表示学习效果、正则化效果以及通过共享参数避免过拟合。
自然语言处理中的多任务学习可以分为跨领域任务、多级别任务、多语言任务和多模态任务。在深度学习框架下,多任务学习通常通过共享多层次的神经网络实现,主要有硬共享、软共享和共享-公共三种形式。
多任务学习的主流基准平台包括decanlp和GLUE。decanlp将多个任务合并成一个多任务学习的训练集,而GLUE则是NYU开发的,与decanlp理念相近,主要用于Q&A和情感分类等任务。尽管这些基准平台仍有改进空间,但它们为多任务学习提供了宝贵的参考。
以上是本次分享的主要内容。完整的公开课视频可通过文末“阅读原文”查看。更多相关信息请访问雷锋网 AI 研习社社区(http://ai.yanxishe.com/)。