IDAX.KMEANS - 构建 K 均值聚类模型

使用此存储过程可构建 K 均值聚类模型,该模型将输入数据聚集到 k 个中心。

权限

此语句的授权标识所拥有的特权必须包括 IDAX_USER 角色。

语法

IDAX.KMEANS(in parameter_string varchar(32672))

参数描述

parameter_string
必需的单字符串参数,其中包含以逗号分隔的 <parameter>=<value> 条目对。
数据类型:VARCHAR(32672)
以下列表显示参数值:
model
必需。
要构建的聚类模型的名称。
数据类型:VARCHAR(64)
intable
必需。
输入表的名称。
数据类型:VARCHAR(128)
outtable
必需。
输出表的名称,用于对每个输入表记录指定聚类。
数据类型:VARCHAR(128)
id
必需。
输入表的列,用于指示唯一实例标识。
数据类型:VARCHAR(128)
distance
可选。
距离函数。
允许的值为“distance=norm_euclidean”和“distance=euclidean”
缺省值:euclidean
数据类型:VARCHAR(14)
k
可选。
聚类中心的数目。
缺省值:3
数据类型:INTEGER
maxiter
可选。
要执行的最大迭代次数。
最小次数为 1。最大次数为 1000。
缺省值:5
数据类型:INTEGER
randseed
可选。
生成器的随机种子值。
缺省值:12345
数据类型:INTEGER
idbased
可选。
指定生成器的随机种子值基于 id 列的值
缺省值:false
数据类型:BOOL
incolumn
可选。
输入表的列,具有以分号 (;) 分隔的特定属性。
每个列都后跟下列一个或多个属性:
  • 名义类型 (:nom) 或连续类型 (:cont)。缺省情况下,数字类型是连续类型,所有其他类型都是名义类型。
  • 角色“:id”、“:target”、“:input”或“:ignore”。
如果未指定此参数,那么输入表的所有列都具有缺省属性。
缺省值:无
数据类型:VARCHAR(32000)
coldeftype
可选。
输入表列的缺省类型。
允许的值为“nom”和“cont”。
如果未指定此参数,那么数字列是连续列,所有其他列都是名义列。
缺省值:无
数据类型:VARCHAR(4)
coldefrole
可选。
输入表列的缺省角色。
允许的值为“input”和“ignore”。
如果未指定此参数,那么所有列都是输入列。
缺省值:input
数据类型:VARCHAR(6)
colPropertiesTable
可选。
输入表,其中存储输入表中各个列的属性。
如果未指定此参数,那么将会自动检测输入表的列属性。
缺省值:无
数据类型:VARCHAR(128)
统计
指示要收集的统计。
允许的值为“none”、“columns”、“values:n”和“all”。
以下条件适用:
  • 如果指定了 statistics=none,那么不会收集任何统计。
  • 如果指定了 statistics=columns,那么将会收集有关输入表列的统计,例如,均值。
  • 如果指定了 statistics=values:n,并且 n 是正数,那么将会收集列和列值的统计。
    最多收集 <n> 项列值统计。
    • 如果名义列包含 <n> 个以上的值,那么仅保留 <n> 个最频繁的列统计。
    • 如果数字列中包含 <n> 个以上的值,那么这些值将离散化,并且将收集离散化值的统计。
  • statistics=all 等同于 statistics=values:100
缺省值:无
数据类型:VARCHAR(32)

返回的信息

以结果集形式返回已生成的聚类数。