资源|100+个自然言语处理数据集大放送,再不愁找不到数据!
造就
2018-12-29 07:39:25
图灵汇官网
开源自然语言处理文本数据集大全
为了帮助大家更好地研究自然语言处理,我们整理了一份详细的开源数据集列表。这份列表按照字母顺序排列,涵盖了各种类型的原始文本数据。以下是精选的一些数据集:
数据集
Apache软件基金会公开邮件档案
- 包含2004年7月11日前所有可用的Apache软件基金会邮件档案。(约200 GB)
- 详情
博主原创语料库
- 包含2004年8月从Blogger.com网站搜集的19,320位博主的帖子,总计681,288个帖子及140多万字。(约298 MB)
- 详情
亚马逊美食评论
- 包含亚马逊用户在2012年10月前留下的568,454条美食评论。(约240 MB)
- 详情
斯坦福大学收集的亚马逊评论
- 收集了3500万条亚马逊评论。(约11 GB)
- 详情
ArXiv论文全文
- 包括收录论文全文(约270 GB)和源文件(约190 GB)。
- 详情
ASAP自动作文评分
- 包含8个作文集,由7年级至10年级的学生撰写,均经过人工评分。(约100 MB)
- 详情
ASAP简答题评分
- 包含由10年级学生撰写的简答题,所有答案均经过人工评分。(约35 MB)
- 详情
政治社交媒体分类
CLiPS文体学研究语料库
- 包含每年扩展的两种类型的写作:文章和综述。(需申请)
- 详情
ClueWeb09 FACC
- 包含带有Freebase注释的ClueWeb09数据。(约72 GB)
- 详情
ClueWeb11 FACC
- 包含带有Freebase注释的ClueWeb11数据。(约92 GB)
- 详情
常见爬虫语料库
- 包含超过50亿个网页的爬虫数据。(约541 TB)
- 详情
康奈尔电影对话语料库
- 包含617部电影的220,579次对话交流。(约9.5 MB)
- 详情
企业信息
- 分类企业在社交媒体上讨论的内容。(约600 KB)
- 详情
CrossWikis
- 关联英语短语与维基百科文章的数据库。(约11 GB)
- 详情
Del.icio.us书签
- 包含delicious.com上的125万个书签。(约40 MB)
- 详情
经济新闻相关文章
- 确定旧闻文章与美国经济的相关性,以及文章的基调。(约12 MB)
- 详情
安然公司电子邮件数据
- 包含1,227,255封电子邮件,其中493,384个附件涉及151位管理者。(约210 GB)
- 详情
联邦采购数据中心的联邦合同
- 包含联邦采购数据中心的所有联邦合同。(约180 GB)
- 详情
Flickr个人分类法
- 包含个人标签的树结构数据集。(约40 MB)
- 详情
Freebase数据库
- 包含Freebase中的理想和推断数据。(约26 GB)
- 详情
Freebase简单主题库
- 包含Freebase中每个主题的基本理想数据。(约5 GB)
- 详情
GigaOM Wordpress挑战赛
- 包含博客文章、元数据和用户偏好。(约1.5 GB)
- 详情
谷歌图书n元语法
- 包含英文单词的n元序列及其观测频率。(约2.2 TB)
- 详情
Gutenberg电子书清单
加拿大议会文本块
- 包含来自加拿大第36届议会正式记录的130万标准文本块。(约82 MB)
- 详情
哈佛图书馆
- 包含超过1,200万册哈佛图书馆的书目记录。(约4 GB)
- 详情
仇恨言论辨认
- 包含近15千行文本,每个文本由三个志愿者判别。(约3 MB)
- 详情
希拉里克林顿的电子邮件
- 包含近7,000页希拉里克林顿的电子邮件。(约12 MB)
- 详情
家得宝公司产品搜索关联
- 包含家得宝公司网站的产品和客户搜索条款。(约65 MB)
- 详情
确定文本中的关键短语
- 包含成绩/答案对和文本组成,用于判别上下文是否与问题相关。(约8 MB)
- 详情
美国电视节目‘风险’
- 包含216,930个出现在‘风险’节目中的问题。(约53 MB)
- 详情
200k英语明文笑话
- 包含208,000种不同来源的明文笑话。(约208,000条)
- 详情
欧洲语言机器翻译
材料安全数据表
- 包含230,000份材料安全数据表。(约3 GB)
- 详情
百万新闻头条-澳大利亚ABC
- 包含澳大利亚ABC新闻从2003年至2017年的130万新闻头条。(约56 MB)
- 详情
MCTest
- 包含660个故事集和相关问题,用于文本理解和问答。(约1 MB)
- 详情
Negra
- 包含德国报纸文本的语法标注语料库。(需申请)
- 详情
新闻头条-印度时报
- 包含印度时报从2001年至2017年的270万新闻头条。(约185 MB)
- 详情
新闻文章/维基百科页面配对
- 包含一篇短文与最匹配的两篇维基百科文章的配对。(约6 MB)
- 详情
2015 NIPS论文
- 包含2015年所有NIPS论文全文。(约335 MB)
- 详情
纽约时报脸谱网数据
- 包含纽约时报在脸谱网上发布的所有帖子。(约5 MB)
- 详情
全球新闻一周供稿
- 包含2017年8月一周内全球发表的140万篇新闻事件数据。(约115 MB)
- 详情
句子/概念对的正确性
- 包含志愿者对概念句子的判断。(约700 KB)
- 详情
公开图书馆数据库
- 包含公开图书馆中所有记录的修正合集。(约16 GB)
- 详情
人物语料库
- 包含作者文章风格和个性预测实验的数据。(需申请)
- 详情
Reddit回复
- 包含截至2015年7月reddit论坛的所有公开回复。(约250 GB)
- 详情
Reddit提交语料库
- 包含2006年1月至2015年8月所有公开可得的Reddit提交内容。(约42 GB)
- 详情
路透社语料库
- 包含路透社新闻报道的数据集,用于自然语言处理的研究。(需签署协议和发送邮件获取)
- 详情
Twitter舆情分析数据集
- 包含不同主题的推文,包括对自动驾驶汽车、美国航空公司、政治事件等的态度分析。(约2.5 MB至47 MB不等)
- 详情
维基百科提取(WEX)
- 包含处理后的英文版维基百科。(约66 GB)
- 详情
雅虎问答中的综合成绩与答案
- 包含雅虎问答语料库中的4,483,032条问答。(约3.6 GB)
- 详情
Yelp
- 包含餐厅排名和220万条评论。(约170万条描述)
- 详情
YouTube视频描述
- 包含170万条YouTube视频描述。(约170万条描述)
- 详情
资源
优秀公开NLP数据集
亚马逊公开数据集
CrowdFlower数据集
Kaggle数据集
Kaggle比赛
开放图书馆
Quora
Reddit数据集
Rs.io
Stackexchange
斯坦福NLP组
雅虎研究院数据集汇总Webscope