资源|100+个自然言语处理数据集大放送,再不愁找不到数据!

图灵汇官网

开源自然语言处理文本数据集大全

为了帮助大家更好地研究自然语言处理,我们整理了一份详细的开源数据集列表。这份列表按照字母顺序排列,涵盖了各种类型的原始文本数据。以下是精选的一些数据集:

数据集

  1. Apache软件基金会公开邮件档案

    • 包含2004年7月11日前所有可用的Apache软件基金会邮件档案。(约200 GB)
    • 详情
  2. 博主原创语料库

    • 包含2004年8月从Blogger.com网站搜集的19,320位博主的帖子,总计681,288个帖子及140多万字。(约298 MB)
    • 详情
  3. 亚马逊美食评论

    • 包含亚马逊用户在2012年10月前留下的568,454条美食评论。(约240 MB)
    • 详情
  4. 斯坦福大学收集的亚马逊评论

    • 收集了3500万条亚马逊评论。(约11 GB)
    • 详情
  5. ArXiv论文全文

    • 包括收录论文全文(约270 GB)和源文件(约190 GB)。
    • 详情
  6. ASAP自动作文评分

    • 包含8个作文集,由7年级至10年级的学生撰写,均经过人工评分。(约100 MB)
    • 详情
  7. ASAP简答题评分

    • 包含由10年级学生撰写的简答题,所有答案均经过人工评分。(约35 MB)
    • 详情
  8. 政治社交媒体分类

    • 包含来自政客的社交媒体消息。(约4 MB)
    • 详情
  9. CLiPS文体学研究语料库

    • 包含每年扩展的两种类型的写作:文章和综述。(需申请)
    • 详情
  10. ClueWeb09 FACC

    • 包含带有Freebase注释的ClueWeb09数据。(约72 GB)
    • 详情
  11. ClueWeb11 FACC

    • 包含带有Freebase注释的ClueWeb11数据。(约92 GB)
    • 详情
  12. 常见爬虫语料库

    • 包含超过50亿个网页的爬虫数据。(约541 TB)
    • 详情
  13. 康奈尔电影对话语料库

    • 包含617部电影的220,579次对话交流。(约9.5 MB)
    • 详情
  14. 企业信息

    • 分类企业在社交媒体上讨论的内容。(约600 KB)
    • 详情
  15. CrossWikis

    • 关联英语短语与维基百科文章的数据库。(约11 GB)
    • 详情
  16. Del.icio.us书签

    • 包含delicious.com上的125万个书签。(约40 MB)
    • 详情
  17. 经济新闻相关文章

    • 确定旧闻文章与美国经济的相关性,以及文章的基调。(约12 MB)
    • 详情
  18. 安然公司电子邮件数据

    • 包含1,227,255封电子邮件,其中493,384个附件涉及151位管理者。(约210 GB)
    • 详情
  19. 联邦采购数据中心的联邦合同

    • 包含联邦采购数据中心的所有联邦合同。(约180 GB)
    • 详情
  20. Flickr个人分类法

    • 包含个人标签的树结构数据集。(约40 MB)
    • 详情
  21. Freebase数据库

    • 包含Freebase中的理想和推断数据。(约26 GB)
    • 详情
  22. Freebase简单主题库

    • 包含Freebase中每个主题的基本理想数据。(约5 GB)
    • 详情
  23. GigaOM Wordpress挑战赛

    • 包含博客文章、元数据和用户偏好。(约1.5 GB)
    • 详情
  24. 谷歌图书n元语法

    • 包含英文单词的n元序列及其观测频率。(约2.2 TB)
    • 详情
  25. Gutenberg电子书清单

    • 包含带注释的电子书清单。(约2 MB)
    • 详情
  26. 加拿大议会文本块

    • 包含来自加拿大第36届议会正式记录的130万标准文本块。(约82 MB)
    • 详情
  27. 哈佛图书馆

    • 包含超过1,200万册哈佛图书馆的书目记录。(约4 GB)
    • 详情
  28. 仇恨言论辨认

    • 包含近15千行文本,每个文本由三个志愿者判别。(约3 MB)
    • 详情
  29. 希拉里克林顿的电子邮件

    • 包含近7,000页希拉里克林顿的电子邮件。(约12 MB)
    • 详情
  30. 家得宝公司产品搜索关联

    • 包含家得宝公司网站的产品和客户搜索条款。(约65 MB)
    • 详情
  31. 确定文本中的关键短语

    • 包含成绩/答案对和文本组成,用于判别上下文是否与问题相关。(约8 MB)
    • 详情
  32. 美国电视节目‘风险’

    • 包含216,930个出现在‘风险’节目中的问题。(约53 MB)
    • 详情
  33. 200k英语明文笑话

    • 包含208,000种不同来源的明文笑话。(约208,000条)
    • 详情
  34. 欧洲语言机器翻译

    • 包含多语言翻译数据。(约612 MB)
    • 详情
  35. 材料安全数据表

    • 包含230,000份材料安全数据表。(约3 GB)
    • 详情
  36. 百万新闻头条-澳大利亚ABC

    • 包含澳大利亚ABC新闻从2003年至2017年的130万新闻头条。(约56 MB)
    • 详情
  37. MCTest

    • 包含660个故事集和相关问题,用于文本理解和问答。(约1 MB)
    • 详情
  38. Negra

    • 包含德国报纸文本的语法标注语料库。(需申请)
    • 详情
  39. 新闻头条-印度时报

    • 包含印度时报从2001年至2017年的270万新闻头条。(约185 MB)
    • 详情
  40. 新闻文章/维基百科页面配对

    • 包含一篇短文与最匹配的两篇维基百科文章的配对。(约6 MB)
    • 详情
  41. 2015 NIPS论文

    • 包含2015年所有NIPS论文全文。(约335 MB)
    • 详情
  42. 纽约时报脸谱网数据

    • 包含纽约时报在脸谱网上发布的所有帖子。(约5 MB)
    • 详情
  43. 全球新闻一周供稿

    • 包含2017年8月一周内全球发表的140万篇新闻事件数据。(约115 MB)
    • 详情
  44. 句子/概念对的正确性

    • 包含志愿者对概念句子的判断。(约700 KB)
    • 详情
  45. 公开图书馆数据库

    • 包含公开图书馆中所有记录的修正合集。(约16 GB)
    • 详情
  46. 人物语料库

    • 包含作者文章风格和个性预测实验的数据。(需申请)
    • 详情
  47. Reddit回复

    • 包含截至2015年7月reddit论坛的所有公开回复。(约250 GB)
    • 详情
  48. Reddit提交语料库

    • 包含2006年1月至2015年8月所有公开可得的Reddit提交内容。(约42 GB)
    • 详情
  49. 路透社语料库

    • 包含路透社新闻报道的数据集,用于自然语言处理的研究。(需签署协议和发送邮件获取)
    • 详情
  50. Twitter舆情分析数据集

    • 包含不同主题的推文,包括对自动驾驶汽车、美国航空公司、政治事件等的态度分析。(约2.5 MB至47 MB不等)
    • 详情
  51. 维基百科提取(WEX)

    • 包含处理后的英文版维基百科。(约66 GB)
    • 详情
  52. 雅虎问答中的综合成绩与答案

    • 包含雅虎问答语料库中的4,483,032条问答。(约3.6 GB)
    • 详情
  53. Yelp

    • 包含餐厅排名和220万条评论。(约170万条描述)
    • 详情
  54. YouTube视频描述

    • 包含170万条YouTube视频描述。(约170万条描述)
    • 详情

资源

  1. 优秀公开NLP数据集

  2. 亚马逊公开数据集

  3. CrowdFlower数据集

    • 包含大量小调查和特定义务的众包数据
    • 详情
  4. Kaggle数据集

  5. Kaggle比赛

    • 包含可在比赛外使用的数据集
    • 详情
  6. 开放图书馆

  7. Quora

    • 包含已标注好的语料库
    • 详情
  8. Reddit数据集

    • 包含多个数据集
    • 详情
  9. Rs.io

    • 包含大量数据集清单
    • 详情
  10. Stackexchange

  11. 斯坦福NLP组

    • 包含已标注的语料库和TreeBanks
    • 详情
  12. 雅虎研究院数据集汇总Webscope

    • 包含运用这些数据的论文列表
    • 详情
本文来源: 图灵汇 文章作者: 造就