本文整理了中文自然语言处理相关的开放任务,涵盖了详细的任务说明、数据集、相关评价指标以及当前的最佳成果。具体任务包括指代消歧、对话状态管理、情绪分类、实体链接、实体标注、语言建模、机器翻译、词性标注、问答、关系抽取等。
背景
指代消歧的任务是在一段文本中识别出具有相同指代内容的文本片段,并将其连接起来。有时这些文本片段的长度为零,表示省略了代词或名词。
示例
输入: 我的姐姐给我她的狗。很喜欢。
输入: [我]的[姐姐]给[我][她]的[狗]。[我]很喜欢[狗]。
标准评价指标
- MUC
- B-cubed
- Entity-based CEAF
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/co-reference_resolution
背景
在面向任务的对话系统中,对话状态管理系统将用户意图作为输入,与知识库交互,并预测系统的下一个动作。自然语言理解组件负责解析用户意图,该组件有时与对话状态管理系统结合成一个单一的端到端学习组件。
标准评价指标
- 句子级别分类准确率
- 对话级别分类准确率
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/dialoguestatemanagement
背景
情绪分类旨在识别叙述者的心理状态。与情感分析不同,情感分析侧重于叙述者对其叙述对象的看法。
示例
输入: 厌恶!你骗我!
输入: 生气
标准评价指标
- 分类准确率
- F1值
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/emotion_classification
背景
实体链接的任务是识别文本片段并将其与标准数据库、知识库、地名词典、维基百科页面等中的对应条目进行链接。文本片段除了专有名词外,还包括指代名词,例如“the player”。
示例
输入: 美国国防部长马蒂斯说,与首尔举行的名为“秃鹫”的军事演习每年春天在韩国停止,但2019年将“减少规模”。
输入: [美国]wiki/UnitedStates国防部长[马蒂斯]wiki/JimMattis说,与[首尔]wiki/Seoul举行的名为“秃鹫”的军事演习每年春天在[韩国]wiki/South_Korea停止,但2019年将“减少规模”。
标准评价指标
- F-score
- NIL mentions聚类评价
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/entity_linking
背景
实体标注任务是识别文本中提到的实体概念,并标注对应的类型,如人(PER)、组织(ORG)、地缘政治实体(GPE)、地点(LOC)等。文本提及除了专有名词外,还包括指代名词,例如“the player”。
示例
输入: 美国国防部长马蒂斯说,与首尔举行的名为“秃鹫”的军事演习每年春天在韩国停止,但2019年将“减少规模”。
输入: [美国]GPE国防部长[马蒂斯]PER说,与[首尔]GPE举行的名为“秃鹫”的军事演习每年春天在[韩国]GPE停止,但[2019年]TMP将“减少规模”。
标准评价指标
- F-score
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/entity_tagging
背景
语言建模任务是对任何文本字符串或语料库的概率进行计算。一个好的语言模型对未观察到的流畅文本应该能输入高概率或低困惑度,反之则输入低概率。
示例
输入: 我们体育界是有决计做到为北京2022年冬季奥运会提供坚实的人才基础。
输入: 60.2困惑度(perplexity)
标准评价指标
- 困惑度 (Perplexity)
- Bits-per-character (bpc)
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/language_modeling
背景
机器翻译任务是将文本从一种语言翻译成另一种语言。这里,我们专注于源语言或目标语言为中文的任务。
示例
输入: 美中两国能够很快达成一个贸易协议。
输入: The United States and China may soon reach a trade agreement.
标准评价指标
- 人工评判
- BLEU score
- NIST
- TER
- HTER
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/machine_translation
背景
词性标注任务是将给定句子中的每个单词从给定标签集中赋予一个词性标签。
示例
输入: 疾速 的 棕色 狐狸 跳过 了 懒散 的 狗。
输入: [疾速]VA[的]DEC[棕色]NN[狐狸]NN[跳过]VV[了]AS[懒散]VA[的]DEC[狗]NN。
标准评价指标
- 准确率
- 召回率
- F1-score
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/pos_tagging
背景
问答任务试图回答以自然语言形式提出的问题。答案可能来自结构化的数据库,也可能来自非结构化的文本片段。
示例
输入: 世界上最大的国家是什么?
输入: 俄罗斯。
标准评价指标
- 准确率
- 完全匹配
- F1-score
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/question_answering
背景
给定两个实体,识别它们的关系并对关系进行分类。
示例
输入: 李晓华和她的丈夫王大牛前日一同去英国游览了。
输入: (entity1: 李晓华, entity2: 王大牛, relation: 夫妻)
标准评价指标
- 准确率
- 召回率
- F1-score
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/relation_extraction
背景
情感分析任务是从文本中识别和提取文本的客观态度信息。
示例
输入: 总的感觉这台机器还不错,适用的有:阴阳历显示,时间与日期快速转换,记事本等。
输入: 正向 (Positive)
标准评价指标
- 准确度
- F1-score
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/sentiment_analysis
背景
繁简转换任务将简体中文字符转换为繁体中文字符,或反之。
示例
输入: 苟利国家生死以,岂因祸福避趋之。
输入: 苟利國家生死以,豈因禍福避趨之。
标准评价指标
- 准确率
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/simplifiedtraditionalChinese_conversion
背景
拼写纠错任务的目标是在文本中查找并更正拼写错误。
示例
输入: 1986年毕业于国防科技大学计算机应用专业,获学士学位。
输入: 1986年毕业于国防科技大学计算机应用专业,获学士学位。
(时 -> 士)
标准评价指标
- 辨认
- 纠正
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/spell_correction
背景
文本摘要任务的输入是一篇长文档,任务的目的是将较长的文本转换成简短、流畅且准确的文本摘要。
示例
输入: 较早进入中国市场的星巴克,是不少小资钟情的品牌。相比在美国的平民形象,星巴克在中国显得“高端”得多。用料并无差别的中杯美式咖啡,在美国仅约合人民币12元,国内要卖21元,相当于贵了75%。第一财经日报。
输入: 媒体称星巴克美式咖啡售价中国比美国贵75%。
标准评价指标
- ROUGE
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/text_summarization
背景
话题分类任务根据文本的主题内容为文本赋予标签或类别。主题有时广泛,类似于流派(新闻、体育、艺术),但有时也会有像标签一样的细粒度。
示例
输入: 国足有决计了 中国国奥队获得热身赛三连胜。
输入: 体育。
标准评价指标
- 准确率
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/topic_classification
背景
音译任务通常在使用不同字母和声系统的语言之间翻译专有名词和技术术语。
示例
输入: 约翰·伍兹 (yue han wu zi)。
输入: John Woods。
标准评价指标
- ACC
- Fuzziness
- MRR
- MAP
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/transliteration
背景
词向量任务通过对大量文本语料进行训练,对每个词返回一个n维的实数向量。这些向量表征了每个词的句法和语义信息,可用于处理各种NLP任务。在中文任务中,词向量的单位除了词以外也可以是字或子字符。
示例
输入: 大文本语料库。
输入: vec("查询") = [-0.059569, 0.126913, 0.273161, 0.225467, -0.185914, 0.018743, -0.18434, 0.083859, -0.115781, -0.216993, 0.063437, -0.005511, 0.276968, …, 0.254486]。
标准评价指标
- 内部任务评价
- 外部任务评价
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/word_embedding
背景
中文中每个汉字即为一个字符。一个单词通常由一个或多个字符组成。单词之间没有空格。分词是将一系列无空格间隔字符串分割成一系列单词的过程。
示例
输入: 亲 请问有什么可以帮您的吗?
输入: 亲 请问 有 什么 可以 帮 您 的 吗 ?
标准评价指标
- F1-score
数据集及最新成果
https://chinesenlp.xyz/#/zh/docs/word_segmentation
希望这些内容对你有所帮助。