<model name>_COLUMN_STATISTICS 表
对于每个聚类,这个表均包含一行。
下表显示表列:
| 列名 | 数据类型 | 描述 |
|---|---|---|
| CLUSTERID(主键列) | INTEGER | 聚类模型中聚类的索引值 如果 CLUSTERID 为 0,那么该行将应用于所有输入记录。 |
| COLUMNNAME(主键列) | VARCHAR(128) | 输入列的名称 |
| CARDINALITY | BIGINT | 相异值的数目 对于连续列,值为 NULL。 |
| MODE | VARCHAR (16000) | 列中对应于 CLUSTERID 的最频繁离散值 |
| MINIMUM | DOUBLE | 最小值 对于非数字列,值为 NULL。 |
| MAXIMUM | DOUBLE | 最大值 对于非数字列,值为 NULL。 |
| MEAN | DOUBLE | 均值 对于非数字列,值为 NULL。 |
| VARIANCE | DOUBLE | 无偏样本方差 对于非数字列,值为 NULL。 |
| VALIDFREQ | BIGINT | 有效值数目 |
| MISSINGFREQ | BIGINT | 缺失值的数目 |
| INVALIDFREQ | BIGINT | 无效值数目 |
| IMPORTANCE | DOUBLE | 正规化卡方值 此值指示聚类中的列分布是否与总体列分布不同。正规化卡方值是一个因子,卡方值与卡方值相差不超过此因子即认为足以实现 99.99% 显著性(考虑自由度)。 |