propriedades chaidnode

Ícone do nó CHAIDO nó CHAID gera árvores de decisão usando estatísticas qui-quadrado para identificar divisões ideais. Ao contrário dos nós Árvore C e R e QUEST, o CHAID pode gerar árvores não binárias, o que significa que algumas divisões têm mais de duas ramificações. Os campos de destino e de entrada podem ser um intervalo numérico (contínuo) ou categóricos. Um CHAID exaustivo é uma modificação de CHAID que faz um trabalho mais profundo de examinar todas as divisões possíveis, porém demora mais tempo para calcular.

Exemplo

stream = modeler.script.stream()
sourcenode = stream.findByID("id46WRP1285C")

node = stream.createAt("chaid", "My node", 200, 100)
stream.link(sourcenode, node)

node.setPropertyValue("custom_fields", True)
node.setPropertyValue("target", "Drug")
node.setPropertyValue("inputs", ["Age", "Na", "K", "Cholesterol", "BP"])
node.setPropertyValue("use_model_name", True)
node.setPropertyValue("model_name", "CHAID")
node.setPropertyValue("method", "Chaid")
node.setPropertyValue("model_output_type", "InteractiveBuilder")
node.setPropertyValue("use_tree_directives", True)
node.setPropertyValue("tree_directives", "Test")
node.setPropertyValue("split_alpha", 0.03)
node.setPropertyValue("merge_alpha", 0.04)
node.setPropertyValue("chi_square", "Pearson")
node.setPropertyValue("use_percentage", False)
node.setPropertyValue("min_parent_records_abs", 40)
node.setPropertyValue("min_child_records_abs", 30)
node.setPropertyValue("epsilon", 0.003)
node.setPropertyValue("max_iterations", 75)
node.setPropertyValue("split_merged_categories", True)
node.setPropertyValue("bonferroni_adjustment", True)
Tabela 1. propriedades chaidnode
Propriedades chaidnode Tipo de dados ou valores. Descrição da propriedade
target campo Os modelos CHAID requerem um único campo de destino e um ou mais campos de entrada. Também é possível especificar uma frequência. Para obter mais informações, consulte Propriedades do nó de modelagem comum
continue_training_existing_model sinalização  
objective
  • Standard
  • Boosting
  • Bagging
  • psm
psm é usado para conjuntos de dados grandes e requer uma conexão do servidor..
model_output_type
  • Single
  • InteractiveBuilder
 
use_tree_directives sinalização  
tree_directives sequência  
method
  • Chaid
  • ExhaustiveChaid
 
use_max_depth
  • Default
  • Custom
 
max_depth Número inteiro Profundidade máxima da árvore, de 0 a 1000. Usado apenas se use_max_depth = Custom.
use_percentage sinalização  
min_parent_records_pc number  
min_child_records_pc number  
min_parent_records_abs number  
min_child_records_abs number  
use_costs sinalização  
costs estruturado Propriedade estruturada.
trails number Número de modelos de componente para boosting ou bagging.
set_ensemble_method
  • Voting
  • HighestProbability
  • HighestMeanProbability
A regra padrão para combinar variáveis resposta categóricas.
range_ensemble_method
  • Mean
  • Median
Regra de combinação padrão para variáveis resposta contínua.
large_boost sinalização Aplica boosting para grandes conjuntos de dados..
split_alpha number Nível de significância para divisão.
merge_alpha number Nível de significância para mesclagem.
bonferroni_adjustment sinalização Ajuste valores de significância usando o método Bonferroni.
split_merged_categories sinalização Permite redivisão de categorias mescladas.
chi_square
  • Pearson
  • LR
O método usado para calcular a estatística qui-quadrado: Pearson ou Razão de Verossimilhança
epsilon number Mudança mínima nas frequências de célula esperadas.
max_iterations number Iterações máximas para convergência.
set_random_seed Número inteiro  
seed number  
calculate_variable_importance sinalização  
calculate_raw_propensities sinalização  
calculate_adjusted_propensities sinalização  
adjusted_propensity_partition
  • Test
  • Validation
 
maximum_number_of_models Número inteiro  
train_pct duplo O algoritmo separa registros internamente em um conjunto de construção de modelo e um conjunto de prevenção de superajuste. O conjunto de prevenção de superajuste é um conjunto independente de registros de dados usados para rastrear erros durante o treinamento, o que evita que o método modele a variação de chance nos dados Especifique uma porcentagem de registros. O padrão é 30.
use_customize_layer Booleano O valor padrão é false. É possível configurar essa propriedade para true se desejar designar campos específicos como pontos para dividir a árvore de decisão.
customize_layer lista Essa propriedade é usada apenas quando use_customize_layer é configurado como true
Esta propriedade é uma lista de objetos Cada um dos objetos tem dois atributos:
  • Layer é um número inteiro que indica a enésima camada específica na árvore de decisão que você deseja customizar. No SPSS Modeler, as camadas iniciam em 0 (raiz).
  • Fields é uma lista de nomes.. Cada nome é um dos campos nos quais você deseja que a árvore de decisão seja potencialmente dividida para esse Layer Esses campos são avaliados pelo SPSS Modeler na ordem em que eles são listados
Quando o fluxo do SPSS Modeler é executado, o algoritmo CHAID avalia e retorna uma lista candidata de campos para dividir com base no valor p para cada camada. Para uma camada customizada, cada campo especificado para a camada é comparado com a lista de candidatos completos de campos. O primeiro campo para corresponder a um campo da lista de candidatos é usado para a divisão. O restante dos campos especificados são ignorados Se nenhum dos campos corresponder, uma mensagem de aviso aparecerá e a árvore será dividida normalmente..