IDAX.REGTREE - 构建并修剪回归树模型

使用此存储过程可通过增长和修剪树来构建回归树模型。

权限

此语句的授权标识所拥有的特权必须包括 IDAX_USER 角色。

语法

IDAX.REGTREE(in parameter_string varchar(32672))

参数描述

parameter_string
必需的单字符串参数,其中包含以逗号分隔的 <parameter>=<value> 条目对。
数据类型:VARCHAR(32672)
以下列表显示参数值:
model
必需。
要构建的回归树模型的名称。
数据类型:VARCHAR(64)
intable
必需。
输入表的名称。
数据类型:VARCHAR(128)
id
必需。
输入表的列,用于指示唯一实例标识。
数据类型:VARCHAR(128)
target
必需。
输入表的列,用于表示预测目标。
数据类型:VARCHAR(128)
incolumn
可选。
输入表的列,具有以分号 (;) 分隔的特定属性。
每个列都后跟下列一个或多个属性:
  • 名义类型 (:nom) 或连续类型 (:cont)。缺省情况下,数字类型是连续类型,所有其他类型都是名义类型。
  • 角色“:id”、“:target”、“:input”或“:ignore”。
如果未指定此参数,那么输入表的所有列都具有缺省属性。
缺省值:无
数据类型:VARCHAR(32000)
coldeftype
可选。
输入表列的缺省类型。
允许的值为“nom”和“cont”。
如果未指定此参数,那么数字列是连续列,所有其他列都是名义列。
缺省值:无
数据类型:VARCHAR(4)
coldefrole
可选。
输入表列的缺省角色。
允许的值为“input”和“ignore”。
如果未指定此参数,那么所有列都是输入列。
缺省值:input
数据类型:VARCHAR(8)
colPropertiesTable
可选。
输入表,其中存储输入表中各个列的属性。
如果未指定此参数,那么将会自动检测输入表的列属性。
缺省值:无
数据类型:VARCHAR(128)
eval
可选。
用于评估拆分的指标。
允许的值为“variance”。
缺省值:variance
数据类型:VARCHAR(8)
minimprove
可选。
评估拆分所需的最小指标改善。
缺省值:0.02
最小值:0.0
数据类型:DOUBLE
minsplit
可选。
可以拆分的每个树节点的最小实例数。
缺省值:50
最小值:2
数据类型:INTEGER
maxdepth
可选。
树层次和叶的最大数目。
缺省值:10
最小值:1
最大值:62
数据类型:INTEGER
valtable
可选。
输入表,其中包含验证数据集。
如果未指定此参数,那么不会执行修剪。
缺省值:无
数据类型:VARCHAR(128)
valweights
可选。
输入表,其中包含验证数据集的可选实例权重或类权重。
缺省值:无
数据类型:VARCHAR(128)
qmeasure
可选。
用于修剪的质量指标。
允许的值为“mse”或“r2”。
缺省值:mse
数据类型:VARCHAR(4)
统计
可选。
指示要收集的统计。
允许的值为“none”、“columns”、“values:n”和“all”。
以下条件适用:
  • 如果指定了 statistics=none,那么不会收集任何统计。
  • 如果指定了 statistics=columns,那么将会收集有关输入表列的统计,例如,均值。
  • 如果指定了 statistics=values:n,并且 n 是正数,那么将会收集列和列值的统计。
    最多收集 <n> 项列值统计。
    • 如果名义列包含 <n> 个以上的值,那么仅保留 <n> 个最频繁的列统计。
    • 如果数字列中包含 <n> 个以上的值,那么这些值将离散化,并且将收集离散化值的统计。
  • statistics=all 等同于 statistics=values:100
缺省值:无
类型:VARCHAR(32)

返回的信息

以结果集形式返回回归树的节点数。

示例

CALL IDAX.REGTREE('model=adult_regtree, intable=adult_train, id=id, target=age, valtable=adult_prune');