自然言语处理NLP(二)
吴昊
2018-12-25 08:33:14
图灵汇官网
词性标注
词性标注是自然语言处理中的一个重要环节,它涉及到对文本中的每个词汇进行标注,以表明其语法属性。标注语料库中包含了多种词性标注及其具体含义。
标注工具
- 自动标注器
- 默许标注器
- 正则表达式标注器
- 查询标注器
- N-gram标注器
- 一元标注器
- 分离训练和测试数据
- 普通的N-gram标注
- 组合标注器
- 标注生词
- 储存标注器
- 功能限制
- 跨句子边界标注
- 隐马尔科夫标注器
隐马尔科夫模型(HMM)
隐马尔科夫模型是一种统计模型,用于描述含有隐含未知参数的马尔科夫过程。难点在于从可观测的参数中确定隐含参数,然后应用这些参数进行进一步分析。隐马尔科夫模型通常表示为一个三元组 (pi, A, B)。
隐马尔科夫模型的基本问题及解决方案
- 对于一个观测序列匹配最有可能的系统,使用前向算法处理。
- 对于已生成的观测序列,确定最有可能的隐藏状态序列,使用维特比算法处理。
- 对于已生成的观测序列,决定最有可能的模型参数,使用前向-后向算法处理。
文本分类
文本分类是指将文本按照一定规则归类到不同的类别中。常见的应用场景包括根据名字判断性别、文本分类、词性分类、句子分割以及识别对话行为。
分类算法
建立分类器的步骤
- 确定输入特征(特征提取器)
- 划分数据集
- 使用训练集构建分类器
- 使用测试集测试分类器的效果
分类的应用场景
- 文档分类
- 特征提取器:关键词是否出现在文档中
- 分类器训练:词性判断
- 特征提取器:词后缀
- 分类器训练:决策树分类器
- 基于上下文的词性判断
- 序列分类
- 句子分割:标点符号的分类任务
- 辨识对话行为类型
评价指标
- 训练集与测试集的划分准确性
- 准确度:正确分类的数量/待分类的数量
- 精确度(Precision):TP / (TP + FP)
- 召回率(Recall):TP / (TP + FN)
- F-度量值(F-score):(2 * Precision * Recall) / (Precision + Recall)
文本聚类
文本聚类是指将文本数据集分成若干个组的过程,每个组内的文本具有较高的相似度,而不同组之间的文本相似度较低。聚类过程中需要考虑的因素包括特征选择、近邻测度、聚类准则和聚类算法。
聚类与分类的区别
- 聚类是在没有预先训练的情况下,如何将样本划分为若干类的问题。在聚类中,事先并不知道数据集中存在哪些类,而是通过某种度量标准,使得在同一聚类内部的相似度最大,而在不同聚类之间的相似度最小。
- 分类则是事先已知数据集中存在的类别,目标是将每条记录标记到正确的类别中。聚类是无监督学习,不需要预先定义类别或带有类别标记的训练实例,而是由聚类学习算法自动确定类别。分类则是有监督学习,利用已有类别标记的数据进行训练。