K 均值聚类

K 均值算法是最广泛使用的聚类算法,它使用显式距离指标将数据集划分为聚类。

K 均值算法的主要概念是,对于数字属性,通过所有训练实例的平均属性值向量来表示每个聚类,而对于名义属性,通过分配到聚类的最常见(最频繁)值向量来表示每个聚类。这种聚类表示法称为聚类中心

以下条件适用于聚类中心:

  • 此算法可处理连续属性和名义属性。
  • 通过应用距离函数将实例与聚类中心匹配,可以计算效率高的方式处理聚类形成和聚类建模的过程。