使用此存储过程可构建 K 均值聚类模型,该模型将输入数据聚集到 k 个中心。
权限
此语句的授权标识所拥有的特权必须包括 IDAX_USER 角色。
语法
IDAX.KMEANS(in parameter_string varchar(32672))
参数描述
- parameter_string
- 必需的单字符串参数,其中包含以逗号分隔的 <parameter>=<value> 条目对。
- 数据类型:VARCHAR(32672)
- 以下列表显示参数值:
-
- model
- 必需。
- 要构建的聚类模型的名称。
- 数据类型:VARCHAR(64)
- intable
- 必需。
- 输入表的名称。
- 数据类型:VARCHAR(128)
- outtable
- 必需。
- 输出表的名称,用于对每个输入表记录指定聚类。
- 数据类型:VARCHAR(128)
- id
- 必需。
- 输入表的列,用于指示唯一实例标识。
- 数据类型:VARCHAR(128)
- distance
- 可选。
- 距离函数。
- 允许的值为“distance=norm_euclidean”和“distance=euclidean”
- 缺省值:euclidean
- 数据类型:VARCHAR(14)
- k
- 可选。
- 聚类中心的数目。
- 缺省值:3
- 数据类型:INTEGER
- maxiter
- 可选。
- 要执行的最大迭代次数。
- 最小次数为 1。最大次数为 1000。
- 缺省值:5
- 数据类型:INTEGER
- randseed
- 可选。
- 生成器的随机种子值。
- 缺省值:12345
- 数据类型:INTEGER
- idbased
- 可选。
- 指定生成器的随机种子值基于 id 列的值
- 缺省值:false
- 数据类型:BOOL
- incolumn
- 可选。
- 输入表的列,具有以分号 (;) 分隔的特定属性。
- 每个列都后跟下列一个或多个属性:
- 名义类型 (:nom) 或连续类型 (:cont)。缺省情况下,数字类型是连续类型,所有其他类型都是名义类型。
- 角色“:id”、“:target”、“:input”或“:ignore”。
- 如果未指定此参数,那么输入表的所有列都具有缺省属性。
- 缺省值:无
- 数据类型:VARCHAR(32000)
- coldeftype
- 可选。
- 输入表列的缺省类型。
- 允许的值为“nom”和“cont”。
- 如果未指定此参数,那么数字列是连续列,所有其他列都是名义列。
- 缺省值:无
- 数据类型:VARCHAR(4)
- coldefrole
- 可选。
- 输入表列的缺省角色。
- 允许的值为“input”和“ignore”。
- 如果未指定此参数,那么所有列都是输入列。
- 缺省值:input
- 数据类型:VARCHAR(6)
- colPropertiesTable
- 可选。
- 输入表,其中存储输入表中各个列的属性。
- 如果未指定此参数,那么将会自动检测输入表的列属性。
- 缺省值:无
- 数据类型:VARCHAR(128)
- 统计
- 指示要收集的统计。
- 允许的值为“none”、“columns”、“values:n”和“all”。
- 以下条件适用:
- 如果指定了 statistics=none,那么不会收集任何统计。
- 如果指定了 statistics=columns,那么将会收集有关输入表列的统计,例如,均值。
- 如果指定了 statistics=values:n,并且 n 是正数,那么将会收集列和列值的统计。
最多收集 <n> 项列值统计。
- 如果名义列包含 <n> 个以上的值,那么仅保留 <n> 个最频繁的列统计。
- 如果数字列中包含 <n> 个以上的值,那么这些值将离散化,并且将收集离散化值的统计。
- statistics=all 等同于 statistics=values:100。
- 缺省值:无
- 数据类型:VARCHAR(32)