K-means 叢集作業的背景

此演算法的運作方式是執行數個相同基本程序的反覆運算。

每一個訓練實例都會指派給最接近的叢集,其與套用至實例及叢集中心的已指定距離函數相關。然後,會重新計算所有叢集中心,作為指派給特定叢集之實例的平均值屬性值向量。叢集中心是透過隨機挑選 k 訓練實例而起始設定,其中 k 是想要的叢集數目。

如果叢集指派完全沒有變更,或如果它們的變更極少,則反覆運算處理程序會停止。不過,實際上,將反覆運算次數指定為範圍 3 - 36 之間的數字通常已足夠。

當您指定 "distance=euclidean" 時,會以 Euclidean 距離來測量距離。當您指定 "distance=norm_euclidean" 時,會以 Normalized Euclidean 距離來測量距離。Normalized Euclidean 距離是比例不變,也就是說,其結果並不取決於所使用的測量單位。例如,測量的一致性為 Mile 相對於 km、$ 相對於 €,以及 °F 相對於 °C。