钟崇光博士参与了《按部就班提升Kaggle竞赛模型准确度,以美国好事达保险公司理赔为例》一文的校正工作,并提出了许多有价值的建议。在此,我们对钟博士表示衷心的感谢!
作者:Melanie Tosik
翻译:闵黎
校正:丁楠雅
本文长度约为1100字,建议阅读时间约3分钟。
Melanie Tosik 目前在旅游搜索公司 WayBlazer 工作,负责利用自然语言请求生成个性化的旅游推荐方案。她在学习过程中积累了不少经验,并整理了一份适合初学者的自然语言处理(NLP)学习资源清单。
Dan Jurafsky 和 Chris Manning 的自然语言处理课程
斯坦福大学 CS224d 课程
Coursera 自然语言处理入门课程
spaCy
自然语言工具包(NLTK)
斯坦福 CoreNLP
《语言和语言处理》(Daniel Jurafsky 和 James H. Martin)
《统计自然语言处理基础》(Chris Manning 和 Hinrich Schütze)
《信息检索简介》(Chris Manning, Prabhakar Raghavan 和 Hinrich Schütze)
《自然语言处理中的神经网络方法》(Yoav Goldberg)
如何在 TensorFlow 中构建 word2vec 模型
NLP 深度学习资源
最后一篇文章:计算语言学和深度学习
分布式表示的自然语言理解
带有泪水的贝叶斯推论
国际计算语言学协会(ACL)
果壳问答网站 (Quora)
Nicolas Iderhoff 创建的 NLP 数据集列表
基于隐马尔可夫模型(HMM)完成词性标注
运用 CYK 算法执行上下文无关的语法解析
计算给定两个单词之间的语义相似度
运用朴素贝叶斯分类器过滤垃圾邮件
根据单词之间的编辑距离执行拼写检查
完成一个马尔科夫链文本生成器
运用 LDA 完成主题模型
运用 word2vec 从大型文本语料库生成单词嵌入