特征工程之N-Gram(二)

1、N-Gram模型 (1)什么是n-gram模型算法        N-Gram是一种基于统计语言模型的算法。它的基本思想是将文本里面的内容按照字节进行大小为N的滑动窗口操做,造成了长度是N的字节片断序列。性能        每个字节片断称为gram,对全部gram的出现频度进行统计,而且按照事先设定好的阈值进行过滤,造成关键gram列表,也就是这个文本的向量特征空间,列表中的每一种gram就是
相关文章
相关标签/搜索