自然言语处理工具hanlp 1.7.3版本更新内容一览

图灵汇官网

HanLP 1.7.3 版本现已发布。HanLP 是一款基于 Java 的自然语言处理工具包,旨在促进自然语言处理技术在日常生活中的应用。该工具包以其功能全面、性能优越、结构清晰、数据更新及时和高度可定制性而著称。

此次更新带来了多项改进和优化:

  1. 默认使用了一个大型模型(来自1998年的《人民日报》六个月的数据)作为感知机词法分析器。
  2. 对 DoubleArrayTrie 进行了优化,解决了编号为 #1136 的问题。
  3. 修正了 ViterbiSegment.dat 的不必要初始化问题。
  4. 改进了词法分析器对动态添加词条的处理,修复了编号为 #271 的问题。
  5. 词法分析器的 seg 接口现在支持自定义词性覆盖统计,修复了编号为 #1156 的问题。
  6. 更新了拼音库。
  7. 提供了新的数据包 data-for-1.7.3.zip,其 MD5 值为 4e4f3695565a75b56427ba4a40731949。
  8. HanLP 的便携版也同步升级至 1.7.3 版本。

以下是 Maven 依赖配置示例: xml <dependency> <groupId>com.hankcs</groupId> <artifactId>hanlp</artifactId> <version>portable-1.7.3</version> </dependency>

HanLP 的设计注重用户体验,外部模块之间耦合度低,模型采用惰性加载方式,服务提供静态化,词典则以明文形式发布。此外,它还配备了一些辅助工具,可以帮助用户训练自己的模型。

本文来源: 图灵汇 文章作者: 漫谈科技