自然言语处理系列篇——关键词智能提取

图灵汇官网

关键词自动标注简介

关键词指的是能够体现文章主题或含义的词语,例如学术论文中的关键字字段。很多人在写作时并不会明确标出关键词,因此产生了关键词自动标注的需求。

关键词自动标注的方法主要分为两种:一种是关键词分配,即从预设的关键词库中选择适合的词语作为文章的关键词;另一种是关键词抽取,即从文章内容中直接抽取关键词。这种方法可以根据文章的具体内容灵活地选择合适的关键词。

运用场景

关键词在早期的文献检索中扮演了重要角色,因为那时的搜索引擎还不支持全文搜索。随着互联网的发展,关键词成为了人们获取信息的重要手段,催生了Google、百度等搜索引擎公司。

在推荐系统中,关键词也发挥了重要作用。例如,当用户阅读某篇新闻时,推荐系统可以基于关键词向用户推荐相关内容或广告。关键词还可以作为用户兴趣的特征,满足用户的多样化阅读需求。传统订阅系统一般以类别或主题作为订阅内容,但关键词提供了更为细致的描述方式,从而更好地满足用户需求。

此外,关键词在文本聚类、分类和摘要等方面也有广泛应用。例如,将关键词相似的文章归为一类可以加快聚类过程,提取某天所有新闻的关键词可以帮助了解当天发生的大事,或者将某段时间内多个人的微博整合后抽取关键词,可以了解他们主要讨论的话题。

现有问题与挑战

关键词通常需要具备可读性、相关性和覆盖度。可读性要求关键词本身要有意义,相关性要求关键词与文章主题紧密关联,覆盖度要求关键词能够全面涵盖文章主题。

关键词标注面临的主要问题包括: - 快速识别新词和短语; - 从文章中筛选出合适的关键词候选; - 计算关键词与文章的相关性; - 覆盖文章的各个主题。

关键词分配方法需要预先定义词库,这限制了其扩展性。关键词抽取方法则在缺乏高质量关键词时效果不佳。为解决这些问题,我们设计了层次化关键词自动标注算法。

层次化关键词自动标注算法

层次化关键词体系

我们设计了一个三层关键词体系来识别新闻的关键词。第一层是新闻频道(如体育、娱乐、科技等),第二层是新闻主题(一篇新闻可能包含多个主题),第三层是文章中的具体标签词。

三层关键词体系的优点在于可以从不同角度描述文章内容,更好地覆盖文章主题,并利用层级关系提取更相关的关键词。

算法流程

首先,获取新闻的类别,然后根据类别选择不同的主题模型预测主题,最后抽取标签词。关键词标注方法融合了关键词分配和关键词抽取两种方法。

文本分类器

我们使用最大熵模型进行文本分类,训练集由带频道标签的新闻组成。每个频道选取相关度最高的1万词语作为分类特征。

主题预测

我们使用LDA模型进行主题聚类。为了处理大规模数据,我们实现了一个分布式LDA平台。LDA处理后的结果是每个主题下概率较高的词语,人工选取高质量主题,并用词语或短语概括主题。对于一篇文章,LDA的结果是一个概率向量,我们选取概率值高于阈值的主题作为文章的主题。

标签词抽取

标签词抽取包括生成候选词和相关性计算两部分。候选词生成过程中,过滤掉停用词和命名实体,相关性计算通过线性加权对候选词打分,最终选取得分高于阈值的候选词作为标签词。

效果评价

我们在腾讯网随机抽取的351篇新闻上进行了测试,结果显示算法在准确率方面表现良好,但由于主题集合的开放性,召回率难以评估。

接入业务与展望

算法还存在一些问题,如泛义词过滤不彻底等,未来将继续改进。目前已接入的业务包括腾讯新闻客户端和手机QQ空间个性化资讯。欢迎有需求的团队联系我们,使用腾讯文智自然语言处理服务。

相关阅读

  • 自然语言处理系列篇——海量数据抓取
  • 自然语言处理系列篇——分布式爬虫之WebKit

参考文献

  • 刘知远. 基于文档主题结构的关键词抽取方法研究[D]. 北京: 清华大学, 2011.
  • Berger A L, Pietra VJ D, Pietra S A D. A maximum entropy approach to natural language processing[J]. Computational linguistics, 1996, 22(1): 39-71.
  • Blei D M, Ng A Y, Jordan M I. Latent dirichlet allocation[J]. the Journal of machine Learning research, 2003, 3: 993-1022.
本文来源: 图灵汇 文章作者: 西洛