自然言语处理NLP(二)

图灵汇官网

词性标注

词性标注是自然语言处理中的一个重要环节,它涉及到对文本中的每个词汇进行标注,以表明其语法属性。标注语料库中包含了多种词性标注及其具体含义。

标注工具

  • 自动标注器
  • 默许标注器
  • 正则表达式标注器
  • 查询标注器
  • N-gram标注器
  • 一元标注器
  • 分离训练和测试数据
  • 普通的N-gram标注
  • 组合标注器
  • 标注生词
  • 储存标注器
  • 功能限制
  • 跨句子边界标注
  • 隐马尔科夫标注器

隐马尔科夫模型(HMM)

隐马尔科夫模型是一种统计模型,用于描述含有隐含未知参数的马尔科夫过程。难点在于从可观测的参数中确定隐含参数,然后应用这些参数进行进一步分析。隐马尔科夫模型通常表示为一个三元组 (pi, A, B)。

隐马尔科夫模型的基本问题及解决方案

  • 对于一个观测序列匹配最有可能的系统,使用前向算法处理。
  • 对于已生成的观测序列,确定最有可能的隐藏状态序列,使用维特比算法处理。
  • 对于已生成的观测序列,决定最有可能的模型参数,使用前向-后向算法处理。

文本分类

文本分类是指将文本按照一定规则归类到不同的类别中。常见的应用场景包括根据名字判断性别、文本分类、词性分类、句子分割以及识别对话行为。

分类算法

  • 朴素贝叶斯分类器
  • 决策树分类器

建立分类器的步骤

  1. 确定输入特征(特征提取器)
  2. 划分数据集
  3. 使用训练集构建分类器
  4. 使用测试集测试分类器的效果

分类的应用场景

  • 文档分类
    • 特征提取器:关键词是否出现在文档中
    • 分类器训练:词性判断
    • 特征提取器:词后缀
    • 分类器训练:决策树分类器
    • 基于上下文的词性判断
  • 序列分类
    • 贪心序列分类
    • 隐马尔科夫模型
  • 句子分割:标点符号的分类任务
  • 辨识对话行为类型

评价指标

  • 训练集与测试集的划分准确性
  • 准确度:正确分类的数量/待分类的数量
  • 精确度(Precision):TP / (TP + FP)
  • 召回率(Recall):TP / (TP + FN)
  • F-度量值(F-score):(2 * Precision * Recall) / (Precision + Recall)

文本聚类

文本聚类是指将文本数据集分成若干个组的过程,每个组内的文本具有较高的相似度,而不同组之间的文本相似度较低。聚类过程中需要考虑的因素包括特征选择、近邻测度、聚类准则和聚类算法。

聚类与分类的区别

  • 聚类是在没有预先训练的情况下,如何将样本划分为若干类的问题。在聚类中,事先并不知道数据集中存在哪些类,而是通过某种度量标准,使得在同一聚类内部的相似度最大,而在不同聚类之间的相似度最小。
  • 分类则是事先已知数据集中存在的类别,目标是将每条记录标记到正确的类别中。聚类是无监督学习,不需要预先定义类别或带有类别标记的训练实例,而是由聚类学习算法自动确定类别。分类则是有监督学习,利用已有类别标记的数据进行训练。
本文来源: 图灵汇 文章作者: 吴昊