Quora在自然语言处理上的所做的工作

图灵汇官网

提升内容质量和社区健康的策略

问答网站的核心在于提供高质量的内容。为了保证内容的优质,需要处理和分析大量的文本数据。Quora拥有海量的文本数据,涵盖数百万个问题、答案和评论,辅以丰富的元数据,如点赞和踩的数量、用户对特定话题的兴趣或擅长程度、话题间的关联、用户的社交关系和影响力等。这些数据使Quora能够从独特的视角出发,利用自然语言处理(NLP)技术解决各种有趣且实用的问题。这些问题主要聚焦于以下三个方面:

  • 维护和提升内容质量:随着内容的不断增长,如何确保内容的质量始终如一。
  • 结构化内容:使知识更易于索引和查找。
  • 保持社区稳定和健康:促进一个积极和谐的社区氛围。

让优质答案优先展示

为了使用户优先看到优质答案,Quora对答案进行评分,评分标准包括以下几个方面:书写风格、可读性、完整性和可靠性。Quora早期采用基于赞成和反对票数量的简单排名机制,虽然效果良好,但也存在一些问题,如时间相关性、马太效应、玩笑答案的流行度以及新用户内容的可见度低等。

为了解决这些问题,Quora采用了非个性化的监督式项目排序方法。Quora定义了一个优秀答案应具备的五个特征:切题、提供可复用的知识、符合基本原理、可信且事实准确、清晰易读。为了实现这一点,Quora使用了多种机器学习方法,包括线性回归、逻辑回归、随机森林、梯度增强树和神经网络等。为了确保模型的可解释性,Quora更倾向于选择简单的模型。

自动纠正语法

为了方便不同英语水平的用户在Quora上写作,Quora利用NLP技术自动改进文本的语法或可读性,而不改变其原始意义。这有助于提高内容的整体质量,使用户更容易理解和接受信息。

问题重复检测

在Quora上,用户经常会遇到相同或相似的问题,这不仅让用户感到困惑,也增加了回答的负担。Quora致力于开发一种系统,能够在用户输入问题时,实时检测到是否有相似的问题已经存在,从而避免重复提问。

相关问题提示

在问题有了答案之后,用户通常希望找到更多相关的问题。Quora通过NLP技术,帮助用户发现更多相关问题,同时确保这些问题与已有问题不完全重复。

话题的专业背景质量

许多在Quora上回答问题的用户是某一领域的专家。Quora需要准确理解这些用户的专业背景,以确保他们在相应话题下的答案具有权威性和可信度。这一过程涉及大量NLP技术的应用,以识别和评估用户的背景信息。

搜索优化

随着Quora知识库的不断增长,搜索功能变得尤为重要。Quora利用NLP技术,更好地理解用户的问题和搜索意图,从而更精准地匹配相关问题、答案和话题。

负面情绪检测

Quora是一个文明互助的社区,不允许侮辱和消极的信息。Quora使用NLP技术,快速检测并清除粗鲁和消极的语言。

垃圾信息检测

为了防止垃圾信息的传播,Quora使用NLP技术自动识别垃圾信息,无论是问题还是答案,都能快速检测并删除。

问题编辑质量检测

Quora允许社区成员改进问题的措辞,但有时这可能导致问题的含义发生改变。Quora正在努力解决这一问题,确保每一次修改都是对问题的改进。

将问题推荐给用户

Quora通过个性化推荐算法,将与用户兴趣高度相关的问答内容推荐给用户。推荐系统主要考虑关联度、质量和需求三个因素,确保推送的内容既相关又吸引人。

将用户推荐给问题

Quora利用机器学习模型,推荐合适的人回答特定问题,以提高回答的质量和效率。

识别问题与时间的关系

Quora通过对特定时间段内与事件相关的单词进行分析,提取出具有代表性的单词,从而更好地理解用户提问的内容,并将其与当时的社会、政治和技术事件联系起来。

通过这些措施,Quora不仅提升了内容的质量,还促进了社区的健康发展,使其成为一个高质量的知识共享平台。

本文来源: 图灵汇 文章作者: 翟辰绪