K 均值聚类
K 均值算法是最广泛使用的聚类算法,它使用显式距离指标将数据集划分为聚类。
K 均值算法的主要概念是,对于数字属性,通过所有训练实例的平均属性值向量来表示每个聚类,而对于名义属性,通过分配到聚类的最常见(最频繁)值向量来表示每个聚类。这种聚类表示法称为聚类中心。
以下条件适用于聚类中心:
- 此算法可处理连续属性和名义属性。
- 通过应用距离函数将实例与聚类中心匹配,可以计算效率高的方式处理聚类形成和聚类建模的过程。
K 均值算法是最广泛使用的聚类算法,它使用显式距离指标将数据集划分为聚类。
K 均值算法的主要概念是,对于数字属性,通过所有训练实例的平均属性值向量来表示每个聚类,而对于名义属性,通过分配到聚类的最常见(最频繁)值向量来表示每个聚类。这种聚类表示法称为聚类中心。
以下条件适用于聚类中心: