K 均值聚类背景

此算法通过执行同一基本过程的多次迭代来操作。

每个训练实例都根据应用于实例和聚类中心的所指定距离函数,分配到最接近的聚类。然后,重新计算所有聚类中心,作为分配到特定聚类的实例的平均属性值向量。聚类中心通过随机选取 k 个训练实例进行初始化,其中 k 是所需聚类数。

当聚类分配完全无变化,或者只有足够少的变化时,迭代过程停止。但是,实际上,指定迭代次数(通常是 3 到 36 范围内的数字)就已足够。

如果指定“distance=euclidean”,那么距离是由欧几里德距离测量而得。如果指定“distance=norm_euclidean”,那么距离是由归一化欧几里德距离测量而得。归一化欧几里德距离的标度恒定,即,结果并不依赖于所用指标的统一。例如,指标的统一包括英里与千米、$ 与 € 以及°F 与°C。