引用自 github , git
概述:github
k-近邻(kNN, k-NearestNeighbor)算法是一种基本分类与回归方法,咱们这里只讨论分类问题中的 k-近邻算法。算法
原理:apache
- 假设有一个带有标签的样本数据集(训练样本集),其中包含每条数据与所属分类的对应关系。
- 输入没有标签的新数据后,将新数据的每一个特征与样本集中数据对应的特征进行比较。
- 计算新数据与样本数据集中每条数据的距离。
- 求得的全部距离进行排序(从小到大,越小表示越类似)。
- 前 k (k 通常小于等于 20 )个样本数据对应的分类标签。
- 求 k 个数据中出现次数最多的分类标签做为新数据的分类。