自然语言处理：文本分词的原理

时间 2021-01-12

原文原文链接

一、中文分词的基本原理因为中文分词，词语之间往往都是连贯的，所以进行分词的时候往往要采取概率模型。现代分词都是基于统计的分词，而统计的样本内容来自于一些标准的语料库。假如有一个句子：“小明来到荔湾区”，我们期望语料库统计后分词的结果是：“小明/来到/荔湾/区”，而不是“小明/来到/荔/湾区”。那么如何做到这一点呢？　　从统计的角度，我们期望"小明/来到/荔湾/区"这个分词后句子出现的概率要

>>阅读原文<<