使用此存储过程可构建概率性朴素贝叶斯分类模型。
权限
此语句的授权标识所拥有的特权必须包括 IDAX_USER 角色。
语法
IDAX.NAIVEBAYES(in parameter_string varchar(32672))
参数描述
- parameter_string
- 必需的单字符串参数,其中包含以逗号分隔的 <parameter>=<value> 条目对。
- 数据类型:VARCHAR(32672)
- 以下列表显示参数值:
-
- model
- 必需。
- 要构建的朴素贝叶斯模型的名称。
- 数据类型:VARCHAR(64)
- intable
- 必需。
- 输入表的名称。
- 数据类型:VARCHAR(128)
- id
- 必需。
- 输入表的列,用于指示唯一实例标识。
- 数据类型:VARCHAR(128)
- target
- 必需。
- 输入表的列,用于表示类
- 数据类型:VARCHAR(128)
- incolumn
- 可选。
- 输入表的列,具有以分号 (;) 分隔的特定属性。
- 每个列都后跟下列一个或多个属性:
- 名义类型 (:nom) 或连续类型 (:cont)。缺省情况下,数字类型是连续类型,所有其他类型都是名义类型。
- 角色“:id”、“:target”、“:input”或“:ignore”。
- 如果未指定此参数,那么输入表的所有列都具有缺省属性。
- 缺省值:无
- 数据类型:VARCHAR(32000)
- coldeftype
- 可选。
- 输入表列的缺省类型。
- 允许的值为“nom”和“cont”。
- 如果未指定此参数,那么数字列是连续列,所有其他列都是名义列。
- 缺省值:无
- 数据类型:VARCHAR(4)
- coldefrole
- 可选。
- 输入表列的缺省角色。
- 允许的值为“input”和“ignore”。
- 如果未指定此参数,那么所有列都是输入列。
- 缺省值:input
- 数据类型:VARCHAR(6)
- colPropertiesTable
- 可选。
- 输入表,其中存储输入表中各个列的属性。
- 如果未指定此参数,那么将会自动检测输入表的列属性。
- 缺省值:无
- 数据类型:VARCHAR(128)
- disc
- 可选。
- 确定所有连续属性的自动离散化。
- 允许的值为 ef、em、ew 和 ewn。
- disc=ef
- 等频离散化。
- 这是一种无监督离散化算法,它将等频条件用于区间界限设置。
- disc=em
- 最小熵离散化。
- 这是一种无监督离散化算法,它将最小熵条件用于区间界限设置。
- disc=ew
- 缺省值。
- 等宽离散化
- 这是一种无监督离散化算法,它将等宽条件用于区间界限设置。它将列的分级宽度计算为
(vmax - vmin)/k,其中:
- vmax
- 列的最大值。
- vmin
- 列的最小值。
- k
- 针对该列请求的离散化分级数。
离散化分级限制置于 vmin + i * w (i = 1, ..., k-1)。
- disc=ewn
- 具有良好分级限制的等宽离散化。
- 无监督离散化算法,它先将列的分级宽度计算为
6 * stddev / k,其中:
- stddev
- 列值的标准差。
- k
- 针对该列请求的离散化分级数。
然后,通过将
k 替换为最接近的值(10 的 1、2、2.5 或 5 次幂),进行宽度优化。最后,它将分级限制设置在列均值附近,使分级限制变为优化宽度的倍数。请注意,生成的分级数可能与请求的分级数不同。
- bins
- 可选。
- 数字列的分级数
- 缺省值:10
- 数据类型:INTEGER
返回的信息
以结果集形式返回贝叶斯模型的列统计、值统计和类统计的数目。