KNN 背景
KNN 算法采用多数表决机制。它从训练数据集收集数据,稍后使用此数据针对新记录进行预测。
对于每条新记录,将会确定训练数据集中的 k 条最近邻记录。根据最近邻记录的目标属性值,针对新记录进行预测。
基本的最近邻 (NN) 算法针对任意实例进行分类预测或回归预测。为了实现此目的,NN 算法确定距离任意实例最近的训练实例。然后,NN 算法返回训练实例的类标签或目标函数值,作为任意实例的预测类标签或目标函数值。
KNN 算法扩展了此过程,即,使用指定数量 (k≥1) 的最近邻训练实例,而不是只使用一个实例。典型的值范围是从 1 到几十。
输出取决于您是将 KNN 算法用于分类还是回归。
- 在 KNN 分类中,预测的类标签由最近邻元素表决确定,即,返回选定的 k 个实例中多数实例所采用的类标签。
- 在 KNN 回归中,将会返回最近邻元素的目标函数值的平均值作为预测值。
通过使用指定的数量 (k≥1),您可以控制过度拟合预防与解决之间的权衡。要处理噪声数据时,应该着重于预防过度拟合。要针对类似实例获得不同的预测时,应该着重于解决过度拟合。