最近在项目中需要从文本中抽取结构化信息,我整理了一些GitHub上的工具包,后续会持续更新。这些工具包不仅功能强大,而且非常有趣,非常适合收集爱好者使用。如果你觉得这些工具对你有帮助,请不要吝啬分享和点赞,非常感谢!
这些工具包涵盖了多种内容,包括但不限于:
下面列举一些具体的工具示例:
textfilter:用于中英文敏感词过滤,例如:
python
from dfa_filter import DFAFilter
f = DFAFilter()
f.add("sexy")
f.filter("hello sexy baby")
langid:一种多语言检测工具,例如:
python
import langid
langid.classify("This is a test")
langdetect:另一种语言检测工具,例如:
python
from langdetect import detect
detect("本篇博客主要介绍两款语言探测工具")
phone:中国手机号码归属地查询,例如:
python
from phone import Phone
p = Phone()
p.find(18100065143)
ngender:根据名字推断性别,例如:
python
import ngender
ngender.guess('赵本山')
cocoNLP:一个强大的信息抽取工具,例如:
python
from cocoNLP.extractor import extractor
ex = extractor()
text = '急寻特朗普,男孩,于2018年11月27号11时在陕西省健康市汉滨区走失。丢失发型短发,...如有线索,请迅速与警方联络:18100065143,132-6156-2938,baizhantang@sina.com.cn 和yangyangfuture at gmail dot com'
emails = ex.extract_email(text)
cellphones = ex.extract_cellphone(text, nation='CHN')
以上只是部分工具示例,每个工具都有详细的文档和使用说明,可以进一步探索和使用。希望这些工具能帮助你更高效地处理文本数据。