IDAX.SPLIT_DATA - 将数据拆分为训练数据和测试数据

使用此存储过程可将输入数据随机拆分为两个分离的子集,即,训练数据集和测试数据集。然后,您可使用所创建的输出表来构建分类模型或回归模型,并测试其预测质量。

权限

此语句的授权标识所拥有的特权必须包括 IDAX_USER 角色。

语法

IDAX.SPLIT_DATA(in parameter_string varchar(32672))

参数描述

parameter_string
必需的单字符串参数,其中包含以逗号分隔的 <parameter>=<value> 条目对。
数据类型:VARCHAR(32672)
以下列表显示参数值:
intable
必需。
输入表的名称。
数据类型:VARCHAR(256)
traintable
必需。
输出表,其中包含部分输入记录。
数据类型:VARCHAR(256)
testtable
必需。
输出表,其中包含其余 (1-<fraction>) 输入记录。
数据类型:VARCHAR(256)
id
必需。
输入表的列,用于指示唯一实例标识。
数据类型:VARCHAR(128)
fraction
可选。
要拆分的数据部分。
最小值:0
最大值:1.0
缺省值:0.5
数据类型:FLOAT
seed
可选。
随机函数的种子值。
缺省值:random()
数据类型:FLOAT

返回的信息

FLOAT:可训练输出表中的记录数。

示例

CALL IDAX.SPLIT_DATA('intable=CENSUSINCOME, id=ID, traintable=CENSUSINCOME_TRAIN, testtable=CENSUSINCOME_TEST, fraction=0.6, seed=1');