收集 K 均值聚类的统计
对于某些应用,统计信息可能并非必需。因此,为节省空间和时间,在缺省情况下不会收集统计。
如果需要收集统计,您可使用额外的参数。此参数指定收集统计的详细级别。
无论统计设置为何,都会存储模型评分所需的所有信息。
对于 K 均值算法,将会存储以下信息:
- 距离函数
- 每个聚类的每个连续列的均值
- 每个聚类的每个分类列的最常见值
如果 statistics=all[:N] 或 statistics=values:N,那么将以各个列的值级别存储所有统计信息。离散统计限制为最多 N 个相异值。N 的缺省值为 100。缺省统计参数为 none。
如果 statistics=columns,那么将以各个列的级别存储所有统计信息,并省略值级别统计。不会创建 <model name>_DISCRETE_STATISTICS 和 <model name>_NUMERIC_STATISTICS。
如果 statistics=none,那么仅存储评分所需的统计信息。