清华大学冯珺:当强化学习遇见自然言语处理有哪些巧妙的化学反应?| 分享总结

图灵汇官网

随着强化学习在机器人和游戏AI等领域取得成功,这种方法逐渐受到更多关注。在近期的雷锋网GAIR大讲堂上,清华大学计算机系博士生冯珺介绍了如何利用强化学习技术解决自然语言处理中的两个经典问题:关系抽取和文本分类。

以下是根据视频整理的内容,如有遗漏,请以原视频为准:


分享主题:

大家好,我是来自清华大学的冯珺。今天分享的主题是“强化学习在自然语言处理中的应用”,主要涵盖以下三个方面:

  1. 强化学习的基本概念
  2. 利用强化学习处理关系抽取中的噪音数据
  3. 利用强化学习改进句子结构化表示的学习方法

强化学习的基本概念

强化学习涉及三个关键要素:状态(state)、动作(action)和奖励(reward)。状态是指智能体(agent)从环境中获得的信息,动作是智能体基于当前状态采取的行为,而奖励是环境对智能体行为的反馈,用来指导智能体选择最优的动作。智能体的目标是选择能使总奖励最大化的动作序列。

如果读者对这些概念还不熟悉,可以通过视频中的迷宫例子加深理解:视频链接


关系抽取

关系分类任务需要判断句子中实体之间的关系。以往的方法依赖人工标注数据,数据集规模较小。后来出现了远程监督方法,希望通过现有资源自动标注更多的数据,但这种方法可能产生错误标注。

我们采用强化学习方法解决远程监督数据中的噪音问题。具体来说,我们设计了一种新模型,包含两个部分:实例选择器(Instance Selector)和关系分类器(Relation Classifier)。实例选择器负责筛选出高质量的句子,关系分类器则基于筛选后的句子进行分类。

实验结果表明,我们的方法能够在含有噪音的数据中实现句子级别的关系分类,而不仅仅是基于文档级别的预测。


文本分类

在文本分类任务中,首先需要构建句子的表示。传统方法包括词袋模型、卷积神经网络(CNN)、循环神经网络(RNN)等,但这些方法通常忽略句子的结构信息。

为了克服这一局限,我们提出了利用强化学习来学习与任务相关的句子结构。通过这种结构化表示,我们能够获得更好的文本分类效果。我们提出的两种表示方法——ID-LSTM和HS-LSTM——在实验中取得了显著的效果。


总结

通过引入强化学习,我们在处理含有噪音的数据时实现了更精确的关系分类,并且通过学习与任务相关的句子结构,提高了文本分类的准确性。这两种方法不仅在实验中表现优异,还为自然语言处理领域提供了新的思路和解决方案。

雷锋网提供了视频直播回放,如果对文中的内容有任何疑问,可以点击观看视频:视频链接

本文来源: 图灵汇 文章作者: 徐孟涵