自然言语处理系列-情感分析-第一期

图灵汇官网

背景

品牌定位、客户服务体验以及客户满意度等词汇在传统商业领域中频繁出现。例如,某些品牌被认为充满活力、阳光和积极;而一些酒店则因其优质的服务和高客户满意度而闻名。然而,进一步思考后会发现,这些概念实际上较为抽象且难以量化。酒店服务质量可以通过星级评价来衡量,但品牌定位则更多地依赖于品牌形象代言和营销手段来塑造。因此,如何准确了解客户的真实想法及其反馈便成为一个亟待解决的问题。传统的方法通常依靠统计学和调查问卷设计相结合的方式进行,例如通过抽样调查和问卷设计等手段来进行数据收集。但在面对海量用户时,传统的问卷抽样方法往往显得力不从心。

假设我们经营一家网店,最真实的客户评价并不是通过市场调研获得的。最直接的信息来源应该是每个订单外的客户评价和反馈。如果我们能够认真阅读并科学地分析这些文本信息,我相信这将是最佳的数据来源之一。如下图所示,这是从淘宝平台上摘取的小米产品订单评价。

从评价中可以看出,第一个差评的客户表达了强烈的不满,提到了快递和产品质量问题。如果有一种方法可以有效提取并分析这些文本中的信息,那将极大地提升我们的工作效率。这也是自然语言处理(NLP)领域所关注的问题之一。

自然语言处理

自然语言处理是机器学习领域中一个热门且前沿的学科(如斯坦福大学公开课程CS224)。随着社交媒体和互联网的发展,大量的数字化文本信息涌现,其中包括了大量的带有观点和态度的文本信息。这使得文本挖掘成为可能,并且具有很高的应用价值。自然语言处理的应用范围广泛,包括聊天机器人、主题识别、盗版文字检测等。

尽管自然语言处理应用广泛且价值巨大,但其实现难度也非常大。大多数人对此应该有所共识。具体而言,自然语言处理面临诸多挑战,主要包括:

  • 非结构化语言:简单的理解就是,人类的语言表达往往缺乏唯一性和统一性。计算机语言通常是结构化的,任何输入都只有一种解读方式。而人类语言则恰恰相反,符号化与内容丰富性并存。
  • 符号化 vs 内容丰富性:人类的文字,字母其实与古代的象形文字或更早的岩石壁画有着相同性质。某个符号代表某个物体或某种意思表达。例如,“Rocket”代表火箭,“Pig”代表猪。这便是符号化,没有原因,只是约定俗成。人类语言更为复杂的是,许多文字背后蕴含着多重含义,例如“自然”这个词。
  • 默认常识:人类语言交流的一个重要前提是双方共享一个“常识库”。例如,“你跑得比乌龟还慢”这句话从语法上讲只是陈述一个事实。但基于“乌龟很慢”的常识,交流双方都知道这句话的真实意思是“你跑得太慢了”。

以上只是自然语言处理面临的一些主要挑战,人类语言的复杂语法和结构问题也使得自然语言处理需要与语言学紧密结合。这也使得自然语言处理成为一门非常有趣且具有挑战性的学科。

情感分析

尽管自然语言处理非常复杂,但如果我们将问题简化呢?比如,只关注其中一个方面?

情感分析正是在这种情况下产生的。如果我们不关心句子的整体含义,只关注其是正面还是负面的呢?

如此一来,问题会变得简单许多。比如,我们可以很容易地从下面的差评中看出负面情绪。负面评价通常由带有明确指向的动词、形容词或副词决定。如果去掉这些词语,该评论可能会变成中性评价。

这次非常不称心,很少差评的,这次真是不爽,第一次见电子产品用EMS快递的,这就算了,物品有质量问题退货还要顾客承担运费,已经第三次在这个店购物了,还这样坑,再也不会来了。

通过这个例子,我们可以发现,识别语言的情感倾向是完全可行的。如果我们能够找出所有带有情感倾向的词汇,是否就能实现文本的情感分析呢?当然,这也是情感分析的一种思路。据我所知,情感分析有许多不同的模型,特别是与神经网络结合的模型大大提升了情感分析的准确性和实用性。

本文介绍了自然语言处理中的情感分析。希望引发大家的兴趣。

接下来的文章将介绍基于词典的情感分析。原创内容,感兴趣的朋友请继续关注。

本文来源: 图灵汇 文章作者: 新智造