用于 K 均值聚类的函数
K 均值算法在 KMEANS 存储过程和 PREDICT_KMEANS 存储过程中实现。要打印 K 均值模型,请使用 PRINT_MODEL 过程。
KMEANS 存储过程和 PREDICT_KMEANS 存储过程具有下列功能:
- 支持连续属性和离散属性的以下计算和表示:
- 基于差值的计算
- 如果值相等,那么假定离散值之间的差值为 0。如果值不相等,那么假定差值为 1。
- 聚类中心表示
- 将众数而非均值用于离散属性。众数就是最频繁值。
- 距离函数 - 归一化欧几里得 (distance=norm_euclidean) 和欧几里得 (distance=euclidean)
缺省值为 euclidean。
- 基于收敛的停止条件,或达到指定的最大迭代次数后停止
- 针对新数据进行聚类成员预测
注: 将会忽略输入表中包含 NULL 值的行。
所有存储过程都有一个必需的单字符串参数,该参数包含 <parameter>=<value> 条目对。这些条目之间以逗号分隔。该参数的数据类型为 VARCHAR(any)。
有效 <parameter>=<value> 条目列示在每个存储过程的参数描述中。