Hanlp天然语言处理中的词典格式说明

使用过hanlp的都知道hanlp中有许多词典,它们的格式都是很是类似的,形式都是文本文档,随时能够修改。本篇文章详细介绍了hanlp中的词典格式,以知足用户自定义的须要。数组

基本格式缓存

词典分为词频词性词典和词频词典。数据结构

一、词频词性词典(如CoreNatureDictionary.txt)编辑器

(1)每一行表明一个单词,格式听从[单词] [词性A] [A的频次] [词性B] [B的频次] ...。性能

(2)支持省略词性和频次,直接一行一个单词。编码

(3).txt词典文件的分隔符为空格或制表符,因此不支持含有空格的词语。若是须要支持空格,请使用英文逗号,分割的纯文本.csv文件。在使用Excel等富文本编辑器时,则请注意保存为纯文本形式。spa

二、词频词典(如CoreNatureDictionary.ngram.txt)调试

(1)每一行表明一个单词或条目,格式听从[单词] [单词的频次]。文档

(2)每一行的分隔符为空格或制表符。同步

少数词典有本身的专用格式,好比同义词词典兼容《同义词词林扩展版》的文本格式,而转移矩阵词典则是一个csv表格。

下文主要介绍通用词典,如不注明,词典特指通用词典。

数据结构

Trie树(字典树)是HanLP中使用最多的数据结构,为此,我实现了通用的Trie树,支持泛型、遍历、储存、载入。

用户自定义词典采用AhoCorasickDoubleArrayTrie和二分Trie树储存,其余词典采用基于双数组Trie树(DoubleArrayTrie)实现的AC自动机AhoCorasickDoubleArrayTrie。关于一些经常使用数据结构的性能评估,请参考wiki。

储存形式

词典有两个形态:文本文件(filename.txt)和缓存文件(filename.txt.bin或filename.txt.trie.dat和filename.txt.trie.value)。

一、文本文件

·采用明文储存,UTF-8编码,CRLF换行符。

二、缓存文件

(1)就是一些二进制文件,一般在文本文件的文件名后面加上.bin表示。有时候是.trie.dat和.trie.value。后者是历史遗留产物,分别表明trie树的数组和值。

(2)若是你修改了任何词典,只有删除缓存才能生效。

修改方法

HanLP的核心词典训练自人民日报2014语料,语料不是完美的,总会存在一些错误。这些错误可能会致使分词出现奇怪的结果,这时请打开调试模式排查问题:

 

HanLP.Config.enableDebug();

 

(1)核心词性词频词典

a)好比你在data/dictionary/CoreNatureDictionary.txt中发现了一个不是词的词,或者词性标注得明显不对,那么你能够修改它,而后删除缓存文件使其生效。

B)目前CoreNatureDictionary.ngram.txt的缓存依赖于CoreNatureDictionary.txt的缓存,修改了后者以后必须同步删除前者的缓存,不然可能出错

(2)核心二元文法词典

a) 二元文法词典data/dictionary/CoreNatureDictionary.ngram.txt储存的是两个词的接续,若是你发现不可能存在这种接续时,删掉便可。

B)你也能够添加你认为合理的接续,可是这两个词必须同时在核心词典中才会生效。

(3)命名实体识别词典

a)基于角色标注的命名实体识别比较依赖词典,因此词典的质量大幅影响识别质量。

b)这些词典的格式与原理都是相似的,请阅读相应的文章或代码修改它。

相关文章
相关标签/搜索