K-Means クラスタリングの統計情報の収集

一部のアプリケーションでは、統計情報が必要ない場合もあります。したがって、スペースと時間を節約するために、統計情報はデフォルトでは収集されません。

統計情報を収集する必要がある場合は、追加のパラメーターを使用できます。このパラメーターで、統計情報の収集の詳細レベルを指定します。

統計情報の設定に関わらず、モデルのスコアリングに必要なすべての情報が保管されます。

K-Means アルゴリズムでは、以下の情報が保管されます。

  • 距離関数
  • クラスターごとの各連続型列の平均値
  • クラスターごとの各カテゴリー列のモーダル値

statistics=all[:N] または statistics=values:N の場合、すべての統計情報は個々の列の値レベルにまで保管されます。離散型統計は、最大 N 個の個別値に制限されています。N のデフォルト値は 100 です。デフォルトの統計情報パラメーターは none です。

statistics=columns の場合、すべての統計情報は個々の列のレベルにまで保管され、値レベルの統計情報は省略されます。<model name>_DISCRETE_STATISTICS および <model name>_NUMERIC_STATISTICS は作成されません。

statistics=none の場合、スコアリングに必要な統計情報のみが保管されます。