propriedades de featureselectionnode
O nó Seleção de Variável verifica campos de entrada para remoção com base em um conjunto de critérios (como a
porcentagem de valores omissos); em seguida, classifica a importância de entradas restantes com relação
a um destino especificado. Por exemplo, dado um conjunto de dados com centenas de entradas potenciais, quais têm maior probabilidade
de serem úteis na modelagem de resultados do paciente?
Exemplo
node = stream.create("featureselection", "My node")
node.setPropertyValue("screen_single_category", True)
node.setPropertyValue("max_single_category", 95)
node.setPropertyValue("screen_missing_values", True)
node.setPropertyValue("max_missing_values", 80)
node.setPropertyValue("criteria", "Likelihood")
node.setPropertyValue("unimportant_below", 0.8)
node.setPropertyValue("important_above", 0.9)
node.setPropertyValue("important_label", "Check Me Out!")
node.setPropertyValue("selection_mode", "TopN")
node.setPropertyValue("top_n", 15)
Propriedades featureselectionnode |
Valores | Descrição da propriedade |
|---|---|---|
target |
campo | Os modelos de Seleção de Recurso classificam preditores com relação ao destino especificado. Os campos de peso e frequência não são usados. Veja Propriedades do nó de modelagem comum para obter mais informações. |
screen_single_category |
sinalização | Se True, os campos de telas que possuem muitos registros cairão na mesma categoria em relação ao número total de registros. |
max_single_category |
number | Especifica o limite usado quando screen_single_category é True. |
screen_missing_values |
sinalização | Se True, os campos de telas com muitos valores ausentes, expressos como uma porcentagem do número total de registros. |
max_missing_values |
number | |
screen_num_categories |
sinalização | Se True, faz triagem de campos com muitas categorias em relação ao número total de registros. |
max_num_categories |
number | |
screen_std_dev |
sinalização | Se True, faz triagem de campos com um desvio padrão menor ou igual ao mínimo especificado. |
min_std_dev |
number | |
screen_coeff_of_var |
sinalização | Se True, faz triagem de campos com coeficiente de variância menor ou igual ao mínimo especificado. |
min_coeff_of_var |
number | |
criteria |
Pearson Likelihood CramersV Lambda |
Ao classificar preditores categóricos com relação a uma variável resposta categórica, especifica a medida na qual o valor de importância é baseado. |
unimportant_below |
number | Especifica o limite de valores p utilizados para classificar variáveis como importantes, marginais ou insignificantes. Aceita valores de 0,0 a 1,0. |
important_above |
number | Aceita valores de 0,0 a 1,0. |
unimportant_label |
sequência | Especifica o rótulo para a classificação não importante. |
marginal_label |
sequência | |
important_label |
sequência | |
selection_mode |
ImportanceLevel ImportanceValue TopN |
|
select_important |
sinalização | Quando selection_mode é configurado como ImportanceLevel, especifica se selecionará campos importantes. |
select_marginal |
sinalização | Quando selection_mode é configurado como ImportanceLevel, especifica se selecionará campos marginais. |
select_unimportant |
sinalização | Quando selection_mode é configurado como ImportanceLevel, especifica se selecionará campos não importantes. |
importance_value |
number | Quando selection_mode é configurado como ImportanceValue, especifica o valor de corte a ser usado. Aceita valores de 0 a 100. |
top_n |
Número inteiro | Quando selection_mode é configurado como TopN, especifica o valor de corte a ser usado. Aceita valores de 0 a 1000. |