中文自然言语处理数据集:ChineseNLPCorpus(附链接)

图灵汇官网

引荐中文自然语言处理数据集

本文旨在介绍一些有价值的中文自然语言处理数据集,帮助大家更好地进行相关领域的研究和实践。

文本分类

  • 今日头条中文新闻分类数据集:包含38万条新闻,分布在15个不同的分类中。数据采集时间为2018年5月,数据按比例划分。
  • 清华新闻分类语料:基于新浪新闻RSS订阅频道2005年至2011年的历史数据,包含74万篇新闻文档。可用于体育、财经、房产等多个分类的小数据实验。
  • 中科大新闻分类语料库:提供了丰富的新闻分类数据资源。

情感/观点/回复倾向性分析

  • ChnSentiCorphtlall:包含7000多条酒店回复数据,其中正向和负向回复分别有5000条和2000条。
  • waimai_10k:收集了某外卖平台的用户评价,正向和负向评价各占4000条和8000条。
  • onlineshopping10_cats:涵盖10个商品类别,共计6万多条回复数据,正向和负向回复各3万条。
  • weibosenti100k:包含10万多条新浪微博数据,正负向回复各5万条。
  • simplifyweibo4moods:包含36万多条新浪微博数据,包含喜悦、愤怒、厌恶、低落四种情感。
  • dmsc_v2:涵盖了28部电影,超过70万用户,超过200万条评分和回复数据。
  • yf_dianping:包括24万家餐馆,54万用户,440万条回复和评分数据。
  • yf_amazon:包含52万件商品,1100多个类别,142万用户,720万条回复和评分数据。

实体识别和词性标注

  • 微博实体识别:提供了多种实体类型的识别数据。
  • boson数据:包含6种实体类型,适合进行实体识别。
  • 1998年人民日报数据集:包含人名、地名、组织名三种实体类型的数据。
  • MSRA微软亚洲研究院数据集:包含5万多条中文命名实体识别标注数据。
  • SIGHAN Bakeoff 2005:包括繁体中文和简体中文的分词数据。

搜索匹配

  • OPPO手机搜索排序数据集:提供了OPPO手机搜索排序query-title语义匹配数据。
  • 网页搜索结果评价(SogouE):提供了用户查询和相关URL列表的数据。

推荐系统

  • ez_douban:包含5万多部电影,2.8万用户,280万条评分数据。
  • dmsc_v2:涵盖了28部电影,超过70万用户,超过200万条评分和回复数据。
  • yf_dianping:包括24万家餐馆,54万用户,440万条回复和评分数据。
  • yf_amazon:包含52万件商品,1100多个类别,142万用户,720万条回复和评分数据。

百科数据

  • 维基百科:定期发布语料库,包含大量的中文语料。
  • 百度百科:可以通过爬虫获取数据。
  • 指代消歧:提供了丰富的数据集。

预训练模型和词向量

  • BERT:提供了开源代码和预训练模型。
  • ELMO:提供了开源代码和预训练模型。
  • 腾讯词向量:提供了800多万中文词汇的词向量数据集。
  • 上百种预训练中文词向量:提供了大量预训练词向量。
  • 中文完形填空数据集:提供了丰富的完形填空数据集。
  • 中华古诗词数据库:包含了大量古诗词数据。
  • 保险行业语料库:提供了丰富的保险行业语料数据。
  • 汉语拆字字典:提供了丰富的拆字数据。

中文数据集平台

  • 搜狗实验室:提供了高质量的中文文本数据集。
  • 中科大自然语言处理与信息检索共享平台:提供了丰富的中文语料数据。
  • 中文语料小数据:包含了命名实体识别、关系识别、阅读理解等小数据集。
  • 维基百科数据集:提供了丰富的维基百科数据集。

NLP工具

  • THULAC:提供了中文分词和词性标注功能。
  • HanLP:提供了多种自然语言处理功能。
  • 哈工大LTP:提供了丰富的自然语言处理工具。
  • NLPIR:提供了多种自然语言处理工具。
  • jieba:提供了中文分词工具。

希望这些数据集和工具能够帮助大家更好地开展中文自然语言处理的研究和应用。

本文来源: 图灵汇 文章作者: 李燕芬