如何经过 SCF 与自然言语处理为网站赋能

图灵汇官网

在撰写博客时,经常需要发布一些文章,但这些文章有时容易被搜索引擎抓取,有时却难以被发现。如何让博客更受搜索引擎青睐呢?一个有效的方法是完善网页的描述(Description)和关键词(Keywords)。不过手动填写这些信息较为繁琐,因此本文将介绍一种利用Python工具实现自动化关键词提取和文本摘要的技术。

准备资源

为了实现这一功能,我们需要准备两个Python库:jiebasnownlp。这两个库可以从以下链接下载:

下载完成后,创建一个新的文件夹,并将相应的文件复制到该文件夹中。接下来,创建一个名为 index.py 的文件,其内容如下:

```python

-- coding: utf8 --

import json import jieba.analyse from snownlp import SnowNLP

def fromsnownlp(text, summarynum): s = SnowNLP(text) return s.summary(summarynum)

def fromjieba(text, keywordstype, keywordsnum): if keywordstype == "tfidf": return jieba.analyse.extracttags(text, topK=keywordsnum) elif keywordstype == "textrank": return jieba.analyse.textrank(text, topK=keywordsnum) else: return None

def mainhandler(event, context): text = event["text"] summarynum = event["summarynum"] keywordsnum = event["keywordsnum"] keywordstype = event["keywordstype"] return { "keywords": fromjieba(text, keywordstype, keywordsnum), "summary": fromsnownlp(text, summary_num) } ```

上传文件

接下来,在SCF平台上创建一个项目,并上传压缩后的文件包。具体步骤如下:

  1. 在SCF平台创建项目。
  2. 将压缩文件命名为 index.zip 并上传。

测试

在测试之前,可以根据需要调整配置参数。例如,可以设置以下输入模板:

json { "text": "前来参观的人群纷至沓来。在“两弹历程馆”里,讲解员龚照怡正在给参观的先生引见:“这是我国第一颗核航弹的模型,长 3 米、直径 1.5 米左右,后面就是它爆炸时产生的蘑菇云。”先生们一边听一边仔细记录。记者看到,馆内应用声、光、电等手段,通过实物、模型、影像材料和场景还原,展现“两弹”研制工作的艰苦历程。“算盘、计算尺这些文物都是激励后人艰苦奋斗的好教材。我们让文物‘回家’,让观众看到当年科研人员住什么样的房子,用什么样的用具,了解在那么艰苦的环境下,他们是怎样研制‘两弹’的,怎样让中国挺起了民族的脊梁。”四川省梓潼两弹城红色旅游开发有限公司副总经理贾鲁蓉告诉记者,作为爱国主义教育基地,这里目前存有 2 万多份图片材料、500 多万字文字材料、3000 余件实物。在“两弹历程馆”的不远处是“将军楼”。1983 年 5 月 20 日,时任国防部部长张爱萍将军离开长卿山视察中物院,看到科学家们在大山沟里艰苦卓绝地工作,即兴赋诗一首:“二十二年难忘情,坎坷道路信踏平。屡建奇功震寰宇,更创奇观惊鬼神。”", "summary_num": 5, "keywords_num": 5, "keywords_type": "tfidf" }

最后,点击测试按钮进行验证。

应用

通过上述步骤,我们实现了关键词提取和文本摘要的自动化。这不仅简化了SEO优化的过程,还提高了博客文章的可见度。你可以将提取的关键词和摘要信息添加到博客的meta标签中,从而增加页面被搜索引擎抓取的可能性。

本文来源: 图灵汇 文章作者: 零科新未来