中文NLP福利!大规模中文自然言语处理语料

图灵汇官网

【新智元导读】本文介绍一个名为nlpchinesecorpus的中文自然语言处理语料库项目。该项目提供了一些预处理过的中文语料,包括维基百科、新闻和百科问答等,方便用户直接下载使用。

目前,高质量的中文语料库相对稀缺。为了弥补这一空白,徐亮创建了一个名为nlpchinesecorpus的项目,提供了多个预处理过的中文语料库,涵盖维基百科、新闻和百科问答等内容。该项目旨在吸引更多人参与贡献语料,有兴趣的朋友可以直接访问GitHub链接,联系作者获取更多详情。

大规模中文自然语言处理语料库

Large Scale Chinese Corpus for NLP

  • 项目地址: https://github.com/brightmart/nlpchinesecorpus
  • 贡献语料: 发送邮件至nlpchinesecorpus@163.com

目标

  • 第一阶段目标:收集1000万条百万级别语料和3000万条千万级别语料(截止2019年5月1日)
  • 第二阶段目标:收集3000万条百万级别语料、1亿条千万级别语料和1亿条亿级别语料(截止2019年12月31日)

为什么需要这个项目?

在中文自然语言处理领域,高质量的语料库非常重要,但获取起来并不容易。许多从业者、研究人员和学生难以找到大量且高质量的中文语料。本文作者尝试通过多种途径寻找中文语料,但收效甚微。该项目正是为了满足这一需求而设立的。

主要语料库

1. 维基百科json版 (wiki2019zh)
  • 包含104万词条(原始文件大小1.6GB,压缩文件519MB)
  • 数据更新时间:2019年2月7日
  • 下载链接:https://pan.baidu.com/s/1uPMlIY3vhusdnhAge318TA

  • 用途:适用于通用中文语料、词向量预训练、知识问答等。

  • 示例结构json { "id": "53", "url": "https://zh.wikipedia.org/wiki?curid=53", "title": "经济学", "text": "经济学是一门对产品和服务的生产、分配和消费进行研究的社会科学。..." }
2. 新闻语料json版 (news2016zh)
  • 包含250万篇新闻(原始数据9GB,压缩文件3.6GB)
  • 时间范围:2014年至2016年
  • 下载链接:https://pan.baidu.com/share/init?surl=LJeq1dkA0wmYd9ZGZw72Xg 密码: film

  • 用途:适用于通用中文语料、词向量预训练、标题生成模型、关键词生成模型等。

  • 示例结构json { "news_id": "610130831", "title": "故宫淡季门票40元 ‘黑导游’卖外地客140元", "desc": "近日有网友微博爆料称,故宫午门广场售票处出现‘黑导游’,专门向外地游客出售高价门票。", "source": "新华网", "time": "03-22 12:00", "content": "近日有网友微博爆料称,故宫午门广场售票处出现‘黑导游’,专门向外地游客出售高价门票。" }
3. 百科问答json版 (baike2018qa)
  • 包含150万个问题和答案(原始数据1GB,压缩文件663MB)
  • 数据更新时间:2018年
  • 下载链接:https://pan.baidu.com/s/12TCEwC_Q3He65HtPKN17cA 密码:fu45

  • 用途:适用于通用中文语料、词向量预训练、百科类问答等。

  • 示例结构json { "qid": "qid_2540946131115409959", "category": "生活知识", "title": "冬天进补好一些呢,还是夏天进补好啊?", "desc": "", "answer": "你好!当然是冬天进补好。夏天人体的胃处于收缩状态,不适合大量进补。..." }

贡献语料

  • 联系方式:发送邮件至nlpchinesecorpus@163.com
  • 激励措施:为感谢贡献者,前20位提供高质量语料的参与者将有机会获得键盘、鼠标、显示器、无线耳机、智能音箱等礼品。

希望更多的人加入这个项目,共同推动中文自然语言处理技术的发展。

本文来源: 图灵汇 文章作者: