IDAX.NAIVEBAYES - 构建朴素贝叶斯模型

使用此存储过程可构建概率性朴素贝叶斯分类模型。

权限

此语句的授权标识所拥有的特权必须包括 IDAX_USER 角色。

语法

IDAX.NAIVEBAYES(in parameter_string varchar(32672))

参数描述

parameter_string
必需的单字符串参数,其中包含以逗号分隔的 <parameter>=<value> 条目对。
数据类型:VARCHAR(32672)
以下列表显示参数值:
model
必需。
要构建的朴素贝叶斯模型的名称。
数据类型:VARCHAR(64)
intable
必需。
输入表的名称。
数据类型:VARCHAR(128)
id
必需。
输入表的列,用于指示唯一实例标识。
数据类型:VARCHAR(128)
target
必需。
输入表的列,用于表示类
数据类型:VARCHAR(128)
incolumn
可选。
输入表的列,具有以分号 (;) 分隔的特定属性。
每个列都后跟下列一个或多个属性:
  • 名义类型 (:nom) 或连续类型 (:cont)。缺省情况下,数字类型是连续类型,所有其他类型都是名义类型。
  • 角色“:id”、“:target”、“:input”或“:ignore”。
如果未指定此参数,那么输入表的所有列都具有缺省属性。
缺省值:无
数据类型:VARCHAR(32000)
coldeftype
可选。
输入表列的缺省类型。
允许的值为“nom”和“cont”。
如果未指定此参数,那么数字列是连续列,所有其他列都是名义列。
缺省值:无
数据类型:VARCHAR(4)
coldefrole
可选。
输入表列的缺省角色。
允许的值为“input”和“ignore”。
如果未指定此参数,那么所有列都是输入列。
缺省值:input
数据类型:VARCHAR(6)
colPropertiesTable
可选。
输入表,其中存储输入表中各个列的属性。
如果未指定此参数,那么将会自动检测输入表的列属性。
缺省值:无
数据类型:VARCHAR(128)
disc
可选。
确定所有连续属性的自动离散化。
允许的值为 efemewewn
disc=ef
等频离散化。
这是一种无监督离散化算法,它将等频条件用于区间界限设置。
disc=em
最小熵离散化。
这是一种无监督离散化算法,它将最小熵条件用于区间界限设置。
disc=ew
缺省值。
等宽离散化
这是一种无监督离散化算法,它将等宽条件用于区间界限设置。它将列的分级宽度计算为 (vmax - vmin)/k,其中:
vmax
列的最大值。
vmin
列的最小值。
k
针对该列请求的离散化分级数。
离散化分级限制置于 vmin + i * w (i = 1, ..., k-1)。
disc=ewn
具有良好分级限制的等宽离散化。
无监督离散化算法,它先将列的分级宽度计算为 6 * stddev / k,其中:
stddev
列值的标准差。
k
针对该列请求的离散化分级数。
然后,通过将 k 替换为最接近的值(10 的 1、2、2.5 或 5 次幂),进行宽度优化。最后,它将分级限制设置在列均值附近,使分级限制变为优化宽度的倍数。请注意,生成的分级数可能与请求的分级数不同。
bins
可选。
数字列的分级数
缺省值:10
数据类型:INTEGER

返回的信息

以结果集形式返回贝叶斯模型的列统计、值统计和类统计的数目。