中文自然言语处理开放义务引见、数据集、当前最佳结果分享

图灵汇官网

本文整理了中文自然语言处理相关的开放任务,涵盖了详细的任务说明、数据集、相关评价指标以及当前的最佳成果。具体任务包括指代消歧、对话状态管理、情绪分类、实体链接、实体标注、语言建模、机器翻译、词性标注、问答、关系抽取等。

目录

  • 指代消歧
  • 对话状态管理
  • 情绪分类
  • 实体链接
  • 实体标注
  • 语言建模
  • 机器翻译
  • 词性标注
  • 问答
  • 关系抽取
  • 情感分析
  • 繁简转换
  • 拼写纠错
  • 文本摘要
  • 话题分类
  • 音译
  • 词向量
  • 中文分词

中文指代消歧

背景
指代消歧的任务是在一段文本中识别出具有相同指代内容的文本片段,并将其连接起来。有时这些文本片段的长度为零,表示省略了代词或名词。

示例
输入: 我的姐姐给我她的狗。很喜欢。

输入: [我]的[姐姐]给[我][她]的[狗]。[我]很喜欢[狗]。

标准评价指标
- MUC - B-cubed - Entity-based CEAF

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/co-reference_resolution

中文对话状态管理

背景
在面向任务的对话系统中,对话状态管理系统将用户意图作为输入,与知识库交互,并预测系统的下一个动作。自然语言理解组件负责解析用户意图,该组件有时与对话状态管理系统结合成一个单一的端到端学习组件。

标准评价指标
- 句子级别分类准确率 - 对话级别分类准确率

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/dialoguestatemanagement

中文情绪分类

背景
情绪分类旨在识别叙述者的心理状态。与情感分析不同,情感分析侧重于叙述者对其叙述对象的看法。

示例
输入: 厌恶!你骗我!

输入: 生气

标准评价指标
- 分类准确率 - F1值

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/emotion_classification

中文实体链接

背景
实体链接的任务是识别文本片段并将其与标准数据库、知识库、地名词典、维基百科页面等中的对应条目进行链接。文本片段除了专有名词外,还包括指代名词,例如“the player”。

示例
输入: 美国国防部长马蒂斯说,与首尔举行的名为“秃鹫”的军事演习每年春天在韩国停止,但2019年将“减少规模”。

输入: [美国]wiki/UnitedStates国防部长[马蒂斯]wiki/JimMattis说,与[首尔]wiki/Seoul举行的名为“秃鹫”的军事演习每年春天在[韩国]wiki/South_Korea停止,但2019年将“减少规模”。

标准评价指标
- F-score - NIL mentions聚类评价

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/entity_linking

中文实体标注

背景
实体标注任务是识别文本中提到的实体概念,并标注对应的类型,如人(PER)、组织(ORG)、地缘政治实体(GPE)、地点(LOC)等。文本提及除了专有名词外,还包括指代名词,例如“the player”。

示例
输入: 美国国防部长马蒂斯说,与首尔举行的名为“秃鹫”的军事演习每年春天在韩国停止,但2019年将“减少规模”。

输入: [美国]GPE国防部长[马蒂斯]PER说,与[首尔]GPE举行的名为“秃鹫”的军事演习每年春天在[韩国]GPE停止,但[2019年]TMP将“减少规模”。

标准评价指标
- F-score

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/entity_tagging

中文语言建模

背景
语言建模任务是对任何文本字符串或语料库的概率进行计算。一个好的语言模型对未观察到的流畅文本应该能输入高概率或低困惑度,反之则输入低概率。

示例
输入: 我们体育界是有决计做到为北京2022年冬季奥运会提供坚实的人才基础。

输入: 60.2困惑度(perplexity)

标准评价指标
- 困惑度 (Perplexity) - Bits-per-character (bpc)

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/language_modeling

中文机器翻译

背景
机器翻译任务是将文本从一种语言翻译成另一种语言。这里,我们专注于源语言或目标语言为中文的任务。

示例
输入: 美中两国能够很快达成一个贸易协议。

输入: The United States and China may soon reach a trade agreement.

标准评价指标
- 人工评判 - BLEU score - NIST - TER - HTER

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/machine_translation

中文词性标注

背景
词性标注任务是将给定句子中的每个单词从给定标签集中赋予一个词性标签。

示例
输入: 疾速 的 棕色 狐狸 跳过 了 懒散 的 狗。

输入: [疾速]VA[的]DEC[棕色]NN[狐狸]NN[跳过]VV[了]AS[懒散]VA[的]DEC[狗]NN。

标准评价指标
- 准确率 - 召回率 - F1-score

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/pos_tagging

中文问答

背景
问答任务试图回答以自然语言形式提出的问题。答案可能来自结构化的数据库,也可能来自非结构化的文本片段。

示例
输入: 世界上最大的国家是什么?

输入: 俄罗斯。

标准评价指标
- 准确率 - 完全匹配 - F1-score

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/question_answering

中文关系抽取

背景
给定两个实体,识别它们的关系并对关系进行分类。

示例
输入: 李晓华和她的丈夫王大牛前日一同去英国游览了。

输入: (entity1: 李晓华, entity2: 王大牛, relation: 夫妻)

标准评价指标
- 准确率 - 召回率 - F1-score

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/relation_extraction

中文情感分析

背景
情感分析任务是从文本中识别和提取文本的客观态度信息。

示例
输入: 总的感觉这台机器还不错,适用的有:阴阳历显示,时间与日期快速转换,记事本等。

输入: 正向 (Positive)

标准评价指标
- 准确度 - F1-score

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/sentiment_analysis

中文繁简转换

背景
繁简转换任务将简体中文字符转换为繁体中文字符,或反之。

示例
输入: 苟利国家生死以,岂因祸福避趋之。

输入: 苟利國家生死以,豈因禍福避趨之。

标准评价指标
- 准确率

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/simplifiedtraditionalChinese_conversion

中文拼写纠错

背景
拼写纠错任务的目标是在文本中查找并更正拼写错误。

示例
输入: 1986年毕业于国防科技大学计算机应用专业,获学士学位。

输入: 1986年毕业于国防科技大学计算机应用专业,获学士学位。

(时 -> 士)

标准评价指标
- 辨认 - 纠正

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/spell_correction

中文文本摘要

背景
文本摘要任务的输入是一篇长文档,任务的目的是将较长的文本转换成简短、流畅且准确的文本摘要。

示例
输入: 较早进入中国市场的星巴克,是不少小资钟情的品牌。相比在美国的平民形象,星巴克在中国显得“高端”得多。用料并无差别的中杯美式咖啡,在美国仅约合人民币12元,国内要卖21元,相当于贵了75%。第一财经日报。

输入: 媒体称星巴克美式咖啡售价中国比美国贵75%。

标准评价指标
- ROUGE

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/text_summarization

中文话题分类

背景
话题分类任务根据文本的主题内容为文本赋予标签或类别。主题有时广泛,类似于流派(新闻、体育、艺术),但有时也会有像标签一样的细粒度。

示例
输入: 国足有决计了 中国国奥队获得热身赛三连胜。

输入: 体育。

标准评价指标
- 准确率

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/topic_classification

中文音译

背景
音译任务通常在使用不同字母和声系统的语言之间翻译专有名词和技术术语。

示例
输入: 约翰·伍兹 (yue han wu zi)。

输入: John Woods。

标准评价指标
- ACC - Fuzziness - MRR - MAP

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/transliteration

中文词向量

背景
词向量任务通过对大量文本语料进行训练,对每个词返回一个n维的实数向量。这些向量表征了每个词的句法和语义信息,可用于处理各种NLP任务。在中文任务中,词向量的单位除了词以外也可以是字或子字符。

示例
输入: 大文本语料库。

输入: vec("查询") = [-0.059569, 0.126913, 0.273161, 0.225467, -0.185914, 0.018743, -0.18434, 0.083859, -0.115781, -0.216993, 0.063437, -0.005511, 0.276968, …, 0.254486]。

标准评价指标
- 内部任务评价 - 外部任务评价

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/word_embedding

中文分词

背景
中文中每个汉字即为一个字符。一个单词通常由一个或多个字符组成。单词之间没有空格。分词是将一系列无空格间隔字符串分割成一系列单词的过程。

示例
输入: 亲 请问有什么可以帮您的吗?

输入: 亲 请问 有 什么 可以 帮 您 的 吗 ?

标准评价指标
- F1-score

数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/word_segmentation

往期精品内容推荐

  • 6部高分美剧,边看边提升口语,坚持每天学习,返200奖学金免费学!
  • 元学习-从小样本学习到快速强化学习-ICML2019
  • 8月最新-《可解释机器学习-Christoph Molnar》-旧书分享
  • 2019年暑期实习、秋招深度学习算法岗面试要点及答案分享
  • 深度学习硬件的过去、现在和未来-Yann LeCun
  • 【干货】史上最全的PyTorch学习资源汇总
  • TensorFlow实现的深度NLP模型集锦
  • 吴恩达新课-《CS230-深度学习基础-2019年春》课程视频分享
  • 免费中文书籍-《神经网络与深度学习》中文版推荐
  • Coursera收费新课-面向AI、机器学习和深度学习的TensorFlow入门推荐
  • 从入门到精通-TensorFlow深度强化学习课程
  • 2019年旧书-《PyTorch实战-一个解决问题的方法》精品教材分享
  • 斯坦福NLP组-2019-《CS224n: NLP与深度学习》-分享

希望这些内容对你有所帮助。

本文来源: 图灵汇 文章作者: 张贺飞