K-means 叢集作業的統計資料收集
對於部分應用程式,可能不需要統計資訊。為了節省空間和時間,依預設不會收集統計資料。
如果您需要收集統計資料,可以使用一個額外參數。此參數指定統計資料收集的詳細程度。
不論統計資料設定為何,都會儲存模型評分所需的所有資訊。
對於 K-means 演算法,會儲存下列資訊:
- 距離函數
- 每個叢集的每個連續直欄的平均值
- 每個叢集的每個種類直欄的限制模式值
如果 statistics=all[:N] 或 statistics=values:N,所有統計資訊都會儲存到個別直欄的值層次。離散統計值最多限制為 N 個相異值。N 的預設值是 100。預設的統計資料參數為 none。
如果 statistics=columns,則會將所有統計資訊儲存至個別直欄的層次,而省略值層次的統計資料。不會建立 <model name>_DISCRETE_STATISTICS 和 <model name>_NUMERIC_STATISTICS。
如果 statistics=none,則僅儲存評分所需的統計資訊。