资源整理了多种数据集,涵盖文本分类、实体识别与词性标注、搜索匹配、推荐系统、指代消歧、百科数据、预训练词向量或模型、以及中文完形填空等领域。这些数据集和工具主要来源于中文自然语言处理社区。
今日头条中文新闻(短文本)分类数据集:该数据集包含38万条新闻,分布在15个分类中,采集于2018年5月。数据集按照70%训练、15%验证和15%测试的比例分割。
清华大学新闻分类语料:基于2005年至2011年新浪新闻的数据生成,包含74万篇新闻文档,总容量为2.19GB。可选择体育、财经、房产、家居、教育、科技、时尚、时政、游戏、娱乐等类别进行小数据实验。数据集还提供了RNN和CNN实验的链接。
中国科学技术大学新闻分类语料库:具体详情请参考其官方网站。
微博实体识别:该项目提供了大量的微博实体识别数据。
博森数据:包含了6种实体类型的数据集。
人民日报数据集:包含人名、地名、组织名三种实体类型的标注数据,分别来自1998年和2004年的新闻报道。
MSRA微软亚洲研究院数据集:包含5万多条中文命名实体识别标注数据,包括地点、机构和人物。
SIGHAN Bakeoff 2005:该数据集包括繁体中文和简体中文的分词数据,其中简体中文数据来自MSR和PKU。
OPPO手机搜索排序:该数据集提供了OPPO手机搜索排序query-title语义匹配的数据。
网页搜索结果评价(SogouE):用户查询及相关URL列表的数据集。
该部分提供了多个推荐系统的数据集,但具体内容在此略去。
维基百科:定期发布的语料库,可用于数据处理和分析。
百度百科:需要自行爬取,提供了相关的爬取链接。
BERT:开源代码和预训练模型下载链接。
ELMO:开源代码和预训练模型下载链接。
腾讯词向量:包含800多万中文词汇的词向量数据集。
上百种预训练中文词向量:提供了多个预训练词向量的数据集。
中文完形填空数据集:提供了相关数据集的链接。
搜狗实验室:提供了多个高质量的中文文本数据集。
中科大自然语言处理与信息检索共享平台:提供了多个中文数据集。
中文语料小数据:包含了少量的中文命名实体识别、关系识别和阅读理解数据。
维基百科数据集:提供了维基百科的数据集链接。
THULAC:提供了中文分词和词性标注的功能。
HanLP:提供了多种自然语言处理功能。
哈工大LTP:提供了中文自然语言处理工具。
NLPIR:提供了多种中文处理工具。
jieba分词:提供了中文分词工具。
以上内容涵盖了多个领域的数据集和工具,旨在帮助开发者更好地理解和应用中文自然语言处理技术。