IDAX.DECTREE - デシジョン・ツリー・モデルの作成およびプルーニング

このストアード・プロシージャーを使用して、ツリーを成長させたりプルーニングしたりすることによってデシジョン・ツリー・モデルを作成します。

許可

ステートメントの許可 ID が保持する特権に、IDAX_USER ロールが含まれている必要があります。

構文

IDAX.DECTREE(in parameter_string varchar(32672))

パラメーターの説明

parameter_string
コンマで区切られた <parameter>=<value> 項目のペアを含む必須の 1 ストリング・パラメーター。
データ型: VARCHAR(32672)
以下のリストに、パラメーター値を示します。
model
必須。
作成されるデシジョン・ツリー・モデルの名前。
データ型: VARCHAR(64)
intable
必須。
入力表の名前。
データ型: VARCHAR(128)
id
必須。
ユニーク・インスタンス ID を識別する入力表列。
データ型: VARCHAR(128)
target
必須。
クラスを表す入力表列。
データ型: VARCHAR(128)
incolumn
オプション。
特定のプロパティーが入っている入力表の列。列はセミコロン (;) で区切ります。
各列の後に、以下のうち 1 つ以上のプロパティーが続きます。
  • 名義型 (「:nom」) または連続型 (「:cont」)。デフォルトでは、数値型は連続型に、それ以外の型は名義型になります。
  • ロール「:id」、「:target」、「:input」、または「:ignore」。
このパラメーターを指定しない場合、入力表のすべての列にデフォルトのプロパティーが使用されます。
デフォルト: なし
データ型: VARCHAR(32000)
coldeftype
オプション。
入力表列のデフォルトの型。
使用できる値は「nom」および「cont」です。
このパラメーターを指定しない場合、数値列は連続型に、それ以外の列は名義型になります。
デフォルト: なし
データ型: VARCHAR(4)
coldefrole
オプション。
入力表列のデフォルトのロール。
使用できる値は「input」および「ignore」です。
このパラメーターを指定しない場合、すべての列が入力列になります。
デフォルト: input
データ型: VARCHAR(8)
colPropertiesTable
オプション。
入力表の列のプロパティーが保管されている入力表。
このパラメーターを指定しない場合、入力表の列プロパティーは自動的に検出されます。
デフォルト: なし
データ型: VARCHAR(128)
weights
オプション。
入力表の列に対するオプションのインスタンスまたはクラスの重みが含まれる入力表。
このパラメーターを指定しない場合、すべての重みの値が 1 になります。
デフォルト: なし
データ型: VARCHAR(128)
eval
オプション。
分割の評価に使用されるクラスの不純度の尺度。
使用できる値は「entropy」および「gini」です。
デフォルト: entropy
データ型: VARCHAR(8)
minimprove
オプション。
分岐の評価に必要な測度の改善度の最小量。
デフォルト: 0.02
最小: 0.0
データ型: DOUBLE
minsplit
オプション。
分割可能な、ツリー・ノードあたりの最小インスタンス数
デフォルト: 50
最小: 2
データ型: INTEGER
maxdepth
オプション。
ツリー・レベルとリーフの最大数。
デフォルト: 10
最小: 1
最大: 62
データ型: INTEGER
valtable
オプション。
検証データ・セットが含まれている入力表。
このパラメーターを指定しない場合、プルーニングは行われません。
デフォルト: なし
データ型: VARCHAR(128)
valweights
オプション。
検証データ・セットに対するオプションのインスタンスの重みまたはクラスの重みが含まれる入力表。
デフォルト: なし
データ型: VARCHAR(128)
qmeasure
オプション。
プルーニングのための品質測度。
使用できる値は「Acc」または「wAcc」です。
デフォルト: Acc
データ型: VARCHAR(4)
statistics
オプション。
収集対象の統計量を指定します。
使用できる値は「none」、「columns」、「values:n」、および「all」です。
以下の条件が適用されます。
  • statistics=none が指定されている場合、統計量は収集されません。
  • statistics=columns が指定されている場合、入力表の列に関する統計量が収集されます (例えば、平均値)。
  • statistics=values:n が指定されており、n が正数の場合、列および列値に関する統計量が収集されます。
    最大 <n> 個の列値の統計量が収集されます。
    • 名義型列に <n> 個を超える値が含まれている場合、最も頻度の高い <n> 個の列の統計量のみが保持されます。
    • 数値列に <n> 個を超える値が含まれている場合、値は離散化され、離散化された値に関する統計量が収集されます。
  • statistics=all は、statistics=values:100 に相当します。
デフォルト: なし
データ型: VARCHAR(32)

戻される情報

結果セットとしてのデシジョン・ツリーのノードの数。

CALL IDAX.DECTREE('model=adult_dectree, intable=adult_train, id=id, target=marital_status, valtable=adult_prune');