收集 K 均值聚类的统计

对于某些应用,统计信息可能并非必需。因此,为节省空间和时间,在缺省情况下不会收集统计。

如果需要收集统计,您可使用额外的参数。此参数指定收集统计的详细级别。

无论统计设置为何,都会存储模型评分所需的所有信息。

对于 K 均值算法,将会存储以下信息:

  • 距离函数
  • 每个聚类的每个连续列的均值
  • 每个聚类的每个分类列的最常见值

如果 statistics=all[:N]statistics=values:N,那么将以各个列的值级别存储所有统计信息。离散统计限制为最多 N 个相异值。N 的缺省值为 100。缺省统计参数为 none

如果 statistics=columns,那么将以各个列的级别存储所有统计信息,并省略值级别统计。不会创建 <model name>_DISCRETE_STATISTICS 和 <model name>_NUMERIC_STATISTICS。

如果 statistics=none,那么仅存储评分所需的统计信息。