使用此存储过程可打印模型,以获取其最重要特征的摘要。因此,您可以获得模型的简要概览。
权限
此语句的授权标识所拥有的特权必须至少包括下列其中一项权限:
- 对源模型的 SELECT 特权
- DATAACCESS 权限
语法
IDAX.PRINT_MODEL(in parameter_string varchar(32672))
参数描述
- parameter_string
- 必需的单字符串参数,其中包含以逗号分隔的 <parameter>=<value> 条目对。
- 数据类型:VARCHAR(32672)
- 以下列表显示参数值:
-
- model
- 必需。
- 要打印的模型的名称。
- 可以使用模式名称来限定模型参数的值,如下所示:
<schema name>.<model name>
返回的信息
结果集形式的打印输出。
结果集的结构取决于模型类型,即,算法以及模型表的格式和内容。
下列存储过程具有其他参数,并且会显示所返回的特定信息。这些算法按字母顺序列出。
示例
CALL IDAX.PRINT_MODEL('model=cc_nb_ewd');
关联规则模型的其他参数
- outtable
- 可选。
- 模型表的名称,模式和规则将会写入其中。
- 缺省值:无
- 数据类型:VARCHAR(128)
- 如果未指定值,那么将仅打印模式或规则。
- type
- 可选。
- 要显示的信息类型。
- 缺省值:rules
- 可能的值为“rules”和“patterns”。
- 数据类型:VARCHAR(8)
- limit
- 可选。
- 要显示的规则或模式的最大数量。
- 缺省值:无
- 范围:>=1
- 数据类型:INTEGER
- 如果未指定值,那么将显示所有规则或模式。
- itemsin
- 可选。
- 一列项目名称,它们必须包含在所显示的规则或模式中。各个项目之间以分号分隔。必须至少包含一个所列项目。
- 缺省值:无
- 数据类型:VARCHAR(32000)
- 当指定 type=rules 参数时,以下条件适用:
- 要指示该项目必须包含在规则头中,项目名称必须以 :h 或 :head 开头。
- 要指示该项目必须包含在规则体中,项目名称必须以 :b 或 :body 开头。
- 如果未指定此参数,那么不会应用任何约束。
- itemsout
- 可选。
- 一列项目名称,它们不得包含在所显示的规则或模式中。各个项目之间以分号分隔。
- 缺省值:无
- 数据类型:VARCHAR(32000)
- 如果未指定此参数,那么不会应用任何约束。
- minlen
- 可选。
- 要显示在规则或模式中的最小项目数。
- 缺省值:1
- 范围:>= 1 且 <= maxlen
- 数据类型:INTEGER
- maxlen
- 可选。
- 要显示在规则或模式中的最大项目数。
- 缺省值:模型的最长模式
- 范围:>= minlen
- 数据类型:INTEGER
- minsupport
- 可选。
- 要显示在规则或模式中的项目的最小支持度。
- 缺省值:0.0
- 范围:>=0.0 且 <=maxsupport
- 数据类型:DOUBLE
- maxsupport
- 可选。
- 要显示在规则或模式中的项目的最大支持度。
- 缺省值:1.0
- 范围:>=minsupport 且 <=1.0
- 数据类型:DOUBLE
- minlift
- 可选。
- 要显示的规则或模式的最小增益。
- 缺省值:0.0
- 范围:>=0.0 且 <=maxlift
- 数据类型:DOUBLE
- maxlift
- 可选。
- 要显示的规则或模式的最大增益。
- 缺省值:模型的模式的最大增益
- 范围:>=minlift
- 数据类型:DOUBLE
- minconf
- 可选。
- 要显示的规则的最小置信度。
- 缺省值:0.0
- 数据类型:DOUBLE
- 范围:>=0.0 且 <=maxconf
- 仅当指定了 type=rules 参数时,才可以指定此参数。
- maxconf
- 可选。
- 要显示的规则的最大置信度。
- 缺省值:1.0
- 数据类型:DOUBLE
- 范围:>=minconf 且 <=1.0
- 仅当指定了 type=rules 参数时,才可以指定此参数。
- sort
- 可选。
- 一列关键字,用于指示显示规则或模式的顺序。列表的顺序为降序。各个项目之间以分号分隔。
- 可能的值为“support”、“confidence”、“lift”和“length”。
- 如果指定了 type=rules 参数,那么缺省值为:support;confidence;length
- 如果指定了 type=patterns 参数,那么缺省值为:support;lift;length
- 数据类型:VARCHAR(32000)
关联规则的返回信息
结果集包含符合所定义约束的所有规则或模式,它们以 sort 参数中指定的顺序排列。
如果指定了 outtable 参数,那么将会创建内容与结果集相同的输出表。
K 均值模型的其他参数
- clusters
- 可选。
- 要打印的模型的聚类标识。
- 各个聚类标识之间以分号 (;) 分隔。
- 如果未指定 clusters,那么将会打印所有聚类的聚类标识。
- columns
- 可选。
- 要打印的模型的输入列名。
- 各个输入列名之间以分号 (;) 分隔。
- 如果未指定 columns,那么将会打印所有输入列的输入列名。
- mode
- 可选。
- 方式,用于确定要打印模型的哪些信息。
- 允许的值为 preview、clusters、centers 和 statistics。
- 如果指定了 mode=preview,那么打印输出将会显示一个表,对于每个输入列,该表均包含相应的一行。对于每个聚类以及总体数据,该表均包含 mean 列(对于数字输入列)和 mode 列(对于名义输入列),并且对于每个聚类大小,该表均包含相应的一行。
- 如果指定了 mode=clusters,那么打印输出将会显示一个表,对于每个聚类,该表均包含相应的一行,列如下所示:clusterid、name、size、withinss 和 description。
- 如果指定了 mode=centers,那么打印输出将会显示一个表,对于每个聚类的每个输入列,该表均包含相应的一行。该表的列如下:clusterid、columnname、cardinality、mode、minimum、maximum、mean、variance、count 和 importance。如果使用 statistics=none 来构建模型,那么该表的列如下:clusterid、columnname、mode(对于名义输入列)和 mean(对于数字输入列)。
- 如果指定了 mode=statistics,那么打印输出将会显示一个表,对于输入列的每个值以及每个聚类,该表均包含相应的一行,列如下所示:clusterid、columnname、value、count、relfrequency、deviation、mean 和 variance。如果使用 statistics=none 或 statistics=columns 来构建模型,那么该表为空。
K 最近邻 (KNN) 的返回信息
结果集包含列属性表,用于描述模型表的标识列、目标列和输入列。将会收集所有输入列的统计。
表 1. 结果集列
| 列名 |
列类型 |
描述 |
| COLNO |
INTEGER |
表中列的秩 |
| NAME |
VARCHAR(128) |
列的名称 |
| SQLTYPE |
VARCHAR(128) |
列的 SQL 类型 |
| LENGTH |
INTEGER |
列的 SQL 类型长度 |
| SCALE |
SMALLINT |
列的 SQL 类型标度 |
| TYPE |
VARCHAR(64) |
列类型,即“nom”或“cont” |
| ROLE |
VARCHAR(64) |
列角色,即,“id”、“target”或“input” |
| CARDINALITY |
BIGINT |
输入列的相异值数 |
| MINIMUM |
DOUBLE |
连续输入列的最小值 |
| MAXIMUM |
DOUBLE |
连续输入列的最大值 |
| MEAN |
DOUBLE |
连续输入列的平均值 |
| VARIANCE |
DOUBLE |
连续输入列的方差 |
| NUMVALID |
BIGINT |
输入列的有效值数目 |
| NUMINVALID |
BIGINT |
输入列的无效值数目 |
| NUMMISSING |
BIGINT |
输入列的 NULL 值数目 |
线性回归的返回信息
结果集取决于创建模型时指定的选项。
- 如果在 calculatediagnostics 参数设置为 false 的情况下创建模型,那么将会返回一个结果集。
- 如果在 calculatediagnostics 参数设置为 true 的情况下创建模型,那么将会返回两个结果集。第二个结果集包含额外的诊断信息。
表 2. 结果集 1 的结果集列
| 列名 |
列类型 |
描述 |
| PREDICTOR |
VARCHAR 可变长度,依赖于预测变量名称的实际长度
|
预测变量(即,创建模型时指定为活动输入列的列)的名称 名义列可包含同一预测变量的多个条目。
如果在 intercept 选项设置为 true 的情况下构建模型,那么结果集中将会包括额外的预测变量“(Intercept)”。此预测变量表示模型构建过程中包括的截距。
|
| PREDICTOR_LEVEL |
VARCHAR 可变长度,依赖于预测变量层次名称的实际长度
|
对于名义列,这是预测变量层次(即,输入表中的列值,针对其创建模型)的名称 如果预测变量为“(Intercept)”或者属连续数据类型,那么此列将特意留空。
|
| COEFFICIENT |
DOUBLE |
创建模型期间确定的预测变量系数 |
| STANDARD_DEVIATION |
DOUBLE |
预测变量系数的标准差 如果在 calculatediagnostics 参数设置为 false 的情况下创建模型,那么值为 -1。
|
表 3. 包含额外诊断信息的结果集 2 的结果集列
| 列名 |
列类型 |
描述 |
| INDICATOR |
VARCHAR() |
包含以下固定值:
- [Y_VAR_EST]
- 误差项方差的估计量。
- [RSS]
- 模型的残差平方和。
- [R²]
- R 平方(模型的判定系数)。
|
| VALUE |
DOUBLE |
指标值 |
PCA 模型的其他参数
- mode
- 可选。
- 方式,用于确定要打印模型的哪些信息。
- 允许的值为 standard 和 summary。
- 缺省值:standard
PCA 的返回信息
结果集取决于创建模型时指定的选项。
指定了 mode=standard 时,输出如下所示:
表 4. 结果集 1 - 主成分的标准差向量
| 列名 |
列类型 |
描述 |
| ID |
VARCHAR(3) |
行索引,始终为“[1]” |
| PC<X> |
DOUBLE |
主成分 <X> 的标准差,其中 X 是 >= 1 且 <= n 的数字 |
表 5. 结果集 2 - 变量载荷矩阵
| 列名 |
列类型 |
描述 |
| ID |
VARCHAR 可变长度,依赖于输入变量的名称
|
输入变量的名称 |
| PC<X> |
DOUBLE |
主成分 <X> 的特征向量值,其中 X 是 >= 1 且 <= n 的数字 |
指定了 mode=summary 时,输出如下所示:
表 6. 结果集 1 - 主成分的关键统计
| 列名 |
列类型 |
描述 |
| MEASURE |
VARCHAR(27) |
仅包含固定值标准差、方差比例和累积比例 |
| PC<X> |
DOUBLE |
主成分 <X> 的指标值,其中 X 是 >= 1 且 <= n 的数字 |
顺序模式的其他参数
- outtable
- 可选。
- 模型表的名称,模式和规则将会写入其中。
- 缺省值:无
- 数据类型:VARCHAR(128)
- 如果未指定值,那么将仅打印模式或规则。
- type
- 可选。
- 要显示的信息类型。
- 缺省值:rules
- 可能的值为“patterns”和“rules”。
- 数据类型:VARCHAR(8)
- limit
- 可选。
- 要显示的模式或规则的最大数量。
- 缺省值:无
- 范围:>=1
- 数据类型:INTEGER
- 如果未指定值,那么将显示所有规则或模式。
- itemsin
- 可选。
- 一列项目名称,它们必须包含在所显示的模式或规则中。各个项目之间以分号分隔。必须至少包含一个所列项目。
- 缺省值:无
- 数据类型:VARCHAR(32000)
- 当指定 type=rules 参数时,以下条件适用:
- 要指示该项目必须包含在规则头中,项目名称必须以 :h 或 :head 开头。
- 要指示该项目必须包含在规则体中,项目名称必须以 :b 或 :body 开头
- 如果未指定此参数,那么不会应用任何约束。
- itemsout
- 可选。
- 一列项目名称,它们不得包含在所显示的模式或规则中。各个项目之间以分号分隔。
- 缺省值:无
- 数据类型:VARCHAR(32000)
- 如果未指定此参数,那么不会应用任何约束。
- minlen
- 可选。
- 每个模式或规则要显示的最小项目数。
- 缺省值:1
- 范围:>= 1 且 <= maxlen
- 数据类型:INTEGER
- maxlen
- 可选。
- 每个模式或规则要显示的最大项目数。
- 缺省值:模型的最长顺序模式
- 范围:>= minlen
- 数据类型:INTEGER
- minsupport
- 可选。
- 要显示的模式或规则的最小支持度。
- 缺省值:0.0
- 范围:>=0.0 且 <=maxsupport
- 数据类型:DOUBLE
- maxsupport
- 可选。
- 要显示的模式或规则的最大支持度。
- 缺省值:1.0
- 范围:>=minsupport 且 <=1.0
- 数据类型:DOUBLE
- minlift
- 可选。
- 要显示的模式或规则的最小增益。
- 缺省值:0.0
- 范围:>=0.0 且 <=maxlift
- 数据类型:DOUBLE
- maxlift
- 可选。
- 要显示的模式或规则的最大增益。
- 缺省值:模型的顺序模式的最大增益
- 范围:>=minlift
- 数据类型:DOUBLE
- minconf
- 可选。
- 要显示的规则的最小置信度。
- 缺省值:0.0
- 数据类型:DOUBLE
- 范围:>=0.0 且 <=maxconf
- 仅当指定了 type=rules 参数时,才可以指定此参数。
- maxconf
- 可选。
- 要显示的规则的最大置信度。
- 缺省值:1.0
- 数据类型:DOUBLE
- 范围:>=minconf 且 <=1.0
- 仅当指定了 type=rules 参数时,才可以指定此参数。
- mintime
- 可选。
- 要显示的规则的规则体与规则头之间的最短时间。
- 如果构建模型所基于的数据序列的事务标识属日期、时间或时间戳记类型,那么此参数的值为秒数。
- 缺省值:0.0
- 数据类型:DOUBLE
- 范围:>0.0 且 <=maxtime
- 仅当指定了 type=rules 参数时,才可以指定此参数。
- maxtime
- 可选。
- 要显示的规则的规则体与规则头之间的最长时间。
- 如果构建模型所基于的数据序列的事务标识属日期、时间或时间戳记类型,那么此参数的值为秒数。
- 缺省值:模型规则的最长相对时间
- 数据类型:DOUBLE
- 范围:>= mintime
- 仅当指定了 type=rules 参数时,才可以指定此参数。
- sort
- 可选。
- 一列关键字,用于指示显示规则或模式的顺序。列表的顺序为降序。各个项目之间以分号分隔。
- 可能的值为“support”、“confidence”、“lift”、“length”和“time”。
- 如果指定了 type=rules 参数,那么缺省值为:support;confidence;length
- 如果指定了 type=patterns 参数,那么缺省值为:support;lift;length
- 数据类型:VARCHAR(32000)
顺序模式的返回信息
结果集包含符合所定义约束的所有模式或规则,它们以 sort 参数中指定的顺序排列。如果指定了 outtable 参数,那么将会创建内容与文本表示相同的输出表。