自然语言处理:文本分词的原理

一、中文分词的基本原理 因为中文分词,词语之间往往都是连贯的,所以进行分词的时候往往要采取概率模型。 现代分词都是基于统计的分词,而统计的样本内容来自于一些标准的语料库。假如有一个句子:“小明来到荔湾区”,我们期望语料库统计后分词的结果是:“小明/来到/荔湾/区”,而不是“小明/来到/荔/湾区”。那么如何做到这一点呢?    从统计的角度,我们期望"小明/来到/荔湾/区"这个分词后句子出现的概率要
相关文章
相关标签/搜索