K-Means クラスタリングの統計情報の収集
一部のアプリケーションでは、統計情報が必要ない場合もあります。したがって、スペースと時間を節約するために、統計情報はデフォルトでは収集されません。
統計情報を収集する必要がある場合は、追加のパラメーターを使用できます。このパラメーターで、統計情報の収集の詳細レベルを指定します。
統計情報の設定に関わらず、モデルのスコアリングに必要なすべての情報が保管されます。
K-Means アルゴリズムでは、以下の情報が保管されます。
- 距離関数
- クラスターごとの各連続型列の平均値
- クラスターごとの各カテゴリー列のモーダル値
statistics=all[:N] または statistics=values:N の場合、すべての統計情報は個々の列の値レベルにまで保管されます。離散型統計は、最大 N 個の個別値に制限されています。N のデフォルト値は 100 です。デフォルトの統計情報パラメーターは none です。
statistics=columns の場合、すべての統計情報は個々の列のレベルにまで保管され、値レベルの統計情報は省略されます。<model name>_DISCRETE_STATISTICS および <model name>_NUMERIC_STATISTICS は作成されません。
statistics=none の場合、スコアリングに必要な統計情報のみが保管されます。