K-Means クラスタリング
K-Means アルゴリズムは、データ・セットをクラスターに分割するために明示的な距離測度を使用する、最も広く使用されるクラスタリング・アルゴリズムです。
K-Means アルゴリズムの主な概念は、各クラスターを、数値属性のすべてのトレーニング・インスタンスの平均属性値のベクトルと、そのクラスターに割り当てられた名義型属性のモーダル (最も頻度の高い) 値のベクトルによって表現することです。このクラスター表現は、クラスター中心 と呼ばれます。
クラスター中心には以下の条件が適用されます。
- アルゴリズムは、連続型属性および名義型属性を処理します。
- インスタンスをクラスター中心と突き合わせる距離関数を適用することにより、クラスター形成とクラスター・モデリングのプロセスを、計算の効率が高い方法で処理できます。