自然言语处理数据集收费资源开放(附学习材料)
金融亮点
2018-12-29 06:25:41
图灵汇官网
自然语言处理入门数据集指南
本文介绍了七个不同类别的自然语言处理小型标准数据集的下载链接,旨在为想要练习自然语言处理的新手提供有用的资源。
在刚开始接触自然语言处理任务时,你需要合适的数据集来进行训练。使用小型数据集能够让你快速下载,并且不需要花费太多时间调试模型。同时,使用广泛使用的标准数据集也很有帮助,因为这样你可以将你的结果与其他研究进行对比,看看是否有所提升。
在这篇文章中,你将会找到一系列标准数据集,帮助你开启深度学习之旅。
总览
本文分为七个部分,分别是:
- 文本分类
- 语言建模
- 图像描述
- 机器翻译
- 问答系统
- 语音识别
- 文档摘要
我尽量提供了一系列广泛应用于学术论文并且规模适中的数据集。几乎所有数据集都是免费公开下载的。
如果你最喜欢的数据集没有被列出,或者你认为有更好的数据集应该被列出,请告诉我。
1. 文本分类
文本分类是指对句子或文档进行标记,例如垃圾邮件分类和情感分析。
以下是几个适合新手的文本分类数据集:
- Reuters-21578
- IMDB 影评情感分类
- 收集自 IMDb 网站的影评及其积极或消极的情感标签,可以在 斯坦福大学 下载。
- 新闻组影评情感分类
- 来自康奈尔大学的影评数据集,可以在 康奈尔大学 下载。
2. 语言建模
语言建模涉及构建一个统计模型,以预测给定上下文中的下一个单词或字母。这是语音识别或机器翻译等任务的基础。
以下是一些适合新手的语言建模数据集:
- Project Gutenberg
- Brown 语料库
- 包含了大量现代美国英语文本,可以在 维基百科 下载。
- Google 10亿词语料库
3. 图像描述
图像描述的任务是为给定的图像生成文字描述。
以下是几个适合新手的图像描述数据集:
- COCO 数据集
- Flickr 8K 数据集
- Flickr 30K 数据集
4. 机器翻译
机器翻译的任务是将一种语言翻译成另一种语言。
以下是几个适合新手的机器翻译数据集:
- 加拿大第36届议会汉萨德数据集
- 欧洲议会会议平行语料库 1996-2011
5. 问答系统
问答系统是指对问题进行回答的任务。
以下是一些适合新手的问答系统数据集:
- 斯坦福问答数据集 (SQuAD)
- 包含了维基百科文章的问答数据,可以在 SQuAD 下载。
- DeepMind 问答数据集
- 包含了 Daily Mail 的旧闻问答数据,可以在 GitHub 下载。
- 亚马逊问答数据
6. 语音识别
语音识别是指将口述语言的录音转换成人类可读的文本。
以下是一些适合新手的语音识别数据集:
- TIMIT 声学-音素连续语音语料库
- VoxForge
- LibriSpeech ASR 语料库
- 包含了 LibriVox 获取的大量英语有声书,可以在 OpenSLR 下载。
7. 文档摘要
文档摘要是指为长文档生成简洁而有意义的描述。
以下是一些适合新手的文档摘要数据集:
- 法律案例报告数据集
- 包含了4000个法律案例及其摘要,可以在 UCI 下载。
- TIPSTER 文本摘要评估会议语料库
- 包含了近200个文档及其摘要,可以在 NIST 下载。
- AQUAINT 英语新闻文本语料库
- 包含了新闻文章的语料库,虽然不是免费的,但被广泛使用,可以在 LDC 下载。
延伸阅读
如果你想了解更多,可以参考以下数据集列表:
- Wikipedia 上的文本数据集
- 计算语言学家和自然语言处理研究人员常用的主要文本语料库
- 斯坦福大学的统计自然语言处理语料库
- NLP 数据集列表
- NLTK 语料库
- DL4J 开放数据集
希望这些数据集能帮助你更好地理解和实践自然语言处理技术。