机器读心术之文本挖掘与自然语言处理

图灵汇官网

在2016年到来之际,由于个人原因,过去一年里未能开展许多知识传播的工作。今年我决心为大家带来惊喜,计划年内完成两门课程:《文本挖掘与自然语言处理》和《神经网络与深度学习》。这两门课程涵盖的技术领域在机器学习中属于前沿且复杂的热点技术,过去几年曾多次向学员许下承诺但未能如期兑现。今年我决定不再拖延,先将课程全部制作完毕,然后再上线,确保不延误、不推迟,同时推动炼数成金课程体系达到新的高度。

在全球范围内,能够系统化讲解这些知识的公开课程非常罕见。自然语言处理和深度学习领域虽然有很多论文构成了知识体系,但成熟的教材却很少。尤其针对汉语处理的著作更是稀缺,导致学习者在理解和掌握这些技术时面临巨大挑战。此外,这些领域涉及复杂的数学算法,如概率图模型(包括隐马尔可夫模型、最大熵模型、条件随机场等)和深度学习中的受限玻尔兹曼机、自编码器、卷积神经网络等,对于数学基础较差的学习者来说,掌握这些内容极为困难。

因此,我开设这两门课程的主要目的是用最易懂的语言讲解最复杂的技术,使即便数学基础不扎实、理解能力一般的大众也能掌握这些前沿技术,并将其应用于实际工作中。这并非一项轻松的任务,但凭借以往在炼数成金上教授其他难度课程的经验以及学员们的鼓励和支持,我有信心将课程完成得更好。

自然语言处理是当前机器学习中最神秘、最热门且最具挑战性的分支之一,其应用前景广泛,包括搜索引擎、语音识别、情感分析等领域。我们可以设想,如果有一台能够理解自然语言并与人类熟练交流的机器,它还会被称为机器吗?文本挖掘是从非结构化文本数据中提取有价值信息的技术,常见应用场景包括处理BBS留言、博客、微博、新闻跟帖等。此外,大型呼叫中心或邮件系统中积累的大量语言记录,通过文本挖掘可以获得宝贵的商业知识。将计算机应用于处理文字、语音和理解语言,这种原本只有高等生物人类才能做到的事情,将产生令人震惊的效果。

课程大纲:

  • 第1课:自然语言处理与文本挖掘概述。强大的系统背后都有一个强大的语料库。
  • 第2课:自动机及其应用,文稿自动校正,歧义消除。
  • 第3课:语言模型和平滑方法。应用案例:语音识别与分词消歧。
  • 第4课:概率图模型,生成式模型与判别式模型,贝叶斯网,马尔科夫链,隐马尔可夫模型HMM。应用案例:语音识别与分词。
  • 第5课:马尔科夫网,最大熵模型,条件随机场CRF。应用案例:使用最大熵消除歧义,使用CRF进行标注。
  • 第6课:汉语分词专题。
  • 第7课:命名实体识别,词性标注,从文本中提取重要内容。
  • 第8课:句法分析,找出句子的重点。
  • 第9课:语义分析与篇章分析,让机器像语言学家一样思考。
  • 第10课:文本分类,情感分析。应用案例:互联网门户自动构建,评论倾向性分析。
  • 第11课:信息检索系统,搜索引擎原理,问答系统。应用案例:客服机器人的制造过程。
  • 第12课:文本深度挖掘:自动文摘与信息抽取。
  • 第13课:机器翻译与语音识别技术介绍,IBM Watson的认知智慧。

授课时间: 课程将于2018年10月15日开课,持续约15周。

授课对象: 对文本挖掘与自然语言处理感兴趣的人员,潜在的研究者、爱好者,以及希望转型成为高级数据分析师或数据科学家的人士。建议最好已经学过炼数成金的《机器学习》课程或具备类似能力。

收获预期: 学员将熟悉文本挖掘与自然语言处理技术,并学会如何将其应用于实际工作,从而将数据挖掘能力从有限的结构化数据扩展到非结构化的海量文本材料。个人的技术能力和数据分析能力将显著提升。

授课讲师: tigerfish,知名数据库网站ITPUB的创始人,知名数据分析网站炼数成金的创始人。他拥有丰富的IT领域和数学领域的知识经验,并将带领他的数据分析团队完成整个授课工作。

本文来源: 图灵汇 文章作者: 柳奕磊