Propriedades randomtrees
O Nó de Árvores Aleatórias é semelhante ao nó C & RT Tree; no entanto, o nó Random Trees é projetado para processar big data para criar uma única árvore. O nó de Árvores Aleatórias gera uma
árvore de decisão que é usada para prever ou classificar observações futuras. O método usa particionamento recursivo para dividir os registros de treinamento em segmentos, minimizando as
impurezas de cada passo, em que um nó na árvore será considerado puro se 100% dos casos no nó
estiverem dentro de uma categoria específica do campo de destino. Os campos de destino e de entrada podem ser intervalos numéricos ou categóricos (nominais, ordinais ou sinalizadores); todas as divisões são binárias (apenas dois subgrupos).
Propriedades randomtrees |
Valores | Descrição da propriedade |
|---|---|---|
target |
campo | No nó Árvores aleatórias, os modelos requerem um único destino e um ou mais campos de entrada. Um campo de frequência também pode ser especificado. Veja Propriedades do nó de modelagem comum para obter mais informações. |
number_of_models |
Número inteiro | Determina o número de modelos a serem construídos como parte da modelagem de combinação. |
use_number_of_predictors |
sinalização | Determina se number_of_predictors é usado. |
number_of_predictors |
Número inteiro | Especifica o número de preditores a serem usados ao construir modelos de divisão. |
use_stop_rule_for_accuracy |
sinalização | Determina se a construção do modelo é interrompida quando a precisão não pode ser melhorada. |
sample_size |
number | Reduza esse valor para melhorar o desempenho quando processar conjuntos de dados muito grandes. |
handle_imbalanced_data |
sinalização | Se o destino do modelo for um resultado de sinalização específico, e a razão do resultado desejado para um resultado não desejado for muito pequena, os dados estarão desbalanceados, e a amostragem de inicialização que é conduzida pelo modelo poderá afetar a precisão do modelo. Ative a manipulação de dados desbalanceados para que o modelo capture uma proporção maior do resultado desejado e gere um modelo mais forte. |
use_weighted_sampling |
sinalização | Quando False, as variáveis de cada nó são selecionadas aleatoriamente com a mesma probabilidade. Quando True, as variáveis são ponderadas e selecionadas de modo apropriado. |
max_node_number |
Número inteiro | Número máximo de nós permitidos em árvores individuais. Se o número exceder na próxima divisão, o crescimento da árvore será interrompido. |
max_depth |
Número inteiro | Profundidade máxima da árvore antes de o crescimento parar. |
min_child_node_size |
Número inteiro | Determina o número mínimo de registros permitidos em um nó-filho após o nó pai ser dividido. Se um nó filho contivesse menos registros do que especificado aqui, o nó pai não seria dividido. |
use_costs |
sinalização | |
costs |
estruturado | Propriedade estruturada. O formato é uma lista de 3 valores: o valor real, o valor previsto e o custo se esta predição estiver errada. Por exemplo:
tree.setPropertyValue("costs", [["drugA", "drugB", 3.0], ["drugX", "drugY", 4.0]]) |
default_cost_increase |
none linear square custom |
Note que isso só é ativado para destinos ordinais. Configure os valores padrão na matriz de custos. |
max_pct_missing |
Número inteiro | Se a porcentagem de valores omissos em qualquer entrada for maior que o valor especificado aqui, a entrada será excluída. Mínimo 0, máximo 100. |
exclude_single_cat_pct |
Número inteiro | Se um valor de categoria representar uma porcentagem de registros maior que a especificada aqui, o campo inteiro será excluído da construção de modelo. Mínimo 1, máximo 99. |
max_category_number |
Número inteiro | Se o número de categorias em um campo exceder esse valor, o campo será excluído da construção de modelo. O mínimo é 2. |
min_field_variation |
number | Se o coeficiente de variação de um campo contínuo for menor que esse valor, o campo será excluído da construção de modelo. |
num_bins |
Número inteiro | Utilizado apenas se os dados forem compostos de entradas contínuas. Configure o número de categorias de frequência igual a ser utilizado para as entradas; as opções são: 2, 4, 5, 10, 20, 25, 50, ou 100. |
topN |
Número inteiro | Especifica o número de regras a relatar. O valor padrão é de 50, com um mínimo de 1 e um máximo de 1000. |