propriedades chaidnode
O nó CHAID gera árvores de decisão usando estatísticas qui-quadrado para identificar divisões ideais. Ao contrário dos nós Árvore C e R e QUEST, o CHAID pode gerar árvores não binárias, o que significa que algumas divisões têm mais de duas ramificações. Os campos de destino e de entrada podem ser um intervalo numérico (contínuo) ou categóricos. Um CHAID exaustivo é uma modificação de CHAID que faz um trabalho mais profundo de examinar todas as divisões possíveis, porém demora mais tempo para calcular.
Exemplo
stream = modeler.script.stream()
sourcenode = stream.findByID("id46WRP1285C")
node = stream.createAt("chaid", "My node", 200, 100)
stream.link(sourcenode, node)
node.setPropertyValue("custom_fields", True)
node.setPropertyValue("target", "Drug")
node.setPropertyValue("inputs", ["Age", "Na", "K", "Cholesterol", "BP"])
node.setPropertyValue("use_model_name", True)
node.setPropertyValue("model_name", "CHAID")
node.setPropertyValue("method", "Chaid")
node.setPropertyValue("model_output_type", "InteractiveBuilder")
node.setPropertyValue("use_tree_directives", True)
node.setPropertyValue("tree_directives", "Test")
node.setPropertyValue("split_alpha", 0.03)
node.setPropertyValue("merge_alpha", 0.04)
node.setPropertyValue("chi_square", "Pearson")
node.setPropertyValue("use_percentage", False)
node.setPropertyValue("min_parent_records_abs", 40)
node.setPropertyValue("min_child_records_abs", 30)
node.setPropertyValue("epsilon", 0.003)
node.setPropertyValue("max_iterations", 75)
node.setPropertyValue("split_merged_categories", True)
node.setPropertyValue("bonferroni_adjustment", True)
Propriedades chaidnode |
Tipo de dados ou valores. | Descrição da propriedade |
|---|---|---|
target |
campo | Os modelos CHAID requerem um único campo de destino e um ou mais campos de entrada. Também é possível especificar uma frequência. Para obter mais informações, consulte Propriedades do nó de modelagem comum |
continue_training_existing_model |
sinalização | |
objective |
|
psm é usado para conjuntos de dados grandes e requer uma conexão do servidor.. |
model_output_type |
|
|
use_tree_directives |
sinalização | |
tree_directives |
sequência | |
method |
|
|
use_max_depth |
|
|
max_depth |
Número inteiro | Profundidade máxima da árvore, de 0 a 1000. Usado apenas se use_max_depth =
Custom. |
use_percentage |
sinalização | |
min_parent_records_pc |
number | |
min_child_records_pc |
number | |
min_parent_records_abs |
number | |
min_child_records_abs |
number | |
use_costs |
sinalização | |
costs |
estruturado | Propriedade estruturada. |
trails |
number | Número de modelos de componente para boosting ou bagging. |
set_ensemble_method |
|
A regra padrão para combinar variáveis resposta categóricas. |
range_ensemble_method |
|
Regra de combinação padrão para variáveis resposta contínua. |
large_boost |
sinalização | Aplica boosting para grandes conjuntos de dados.. |
split_alpha |
number | Nível de significância para divisão. |
merge_alpha |
number | Nível de significância para mesclagem. |
bonferroni_adjustment |
sinalização | Ajuste valores de significância usando o método Bonferroni. |
split_merged_categories |
sinalização | Permite redivisão de categorias mescladas. |
chi_square |
|
O método usado para calcular a estatística qui-quadrado: Pearson ou Razão de Verossimilhança |
epsilon |
number | Mudança mínima nas frequências de célula esperadas. |
max_iterations |
number | Iterações máximas para convergência. |
set_random_seed |
Número inteiro | |
seed |
number | |
calculate_variable_importance |
sinalização | |
calculate_raw_propensities |
sinalização | |
calculate_adjusted_propensities |
sinalização | |
adjusted_propensity_partition |
|
|
maximum_number_of_models |
Número inteiro | |
train_pct |
duplo | O algoritmo separa registros internamente em um conjunto de construção de modelo e um conjunto de prevenção de superajuste. O conjunto de prevenção de superajuste é um conjunto independente de registros de dados usados para rastrear erros durante o treinamento, o que evita que o método modele a variação de chance nos dados Especifique uma porcentagem de registros. O padrão é 30. |
use_customize_layer |
Booleano | O valor padrão é false. É possível configurar essa propriedade para true se desejar designar campos específicos como pontos para dividir a árvore de decisão. |
customize_layer |
lista | Essa propriedade é usada apenas quando use_customize_layer é configurado como trueEsta propriedade é uma lista de objetos Cada um dos objetos tem dois atributos: Quando o fluxo do SPSS Modeler é executado, o algoritmo CHAID avalia e retorna uma lista candidata de campos para dividir com base no valor
p para cada camada. Para uma camada customizada, cada campo especificado para a camada é comparado com a lista de candidatos completos de campos. O primeiro campo para corresponder a um campo da lista de candidatos é usado para a divisão. O restante dos campos especificados são ignorados Se nenhum dos campos corresponder, uma mensagem de aviso aparecerá e a árvore será dividida normalmente.. |