Propriedades de autoclusternode
O nó Cluster Automático estima e compara modelos de armazenamento em cluster, que identificam grupos de registros com características semelhantes. O nó trabalha da mesma maneira que outros nós de modelagem automatizados, permitindo experimentar várias combinações de opções em uma única passagem de modelagem. Modelos podem ser comparados usando medidas básicas com as quais você tentar filtrar e ranquear a utilidade dos modelos de cluster e fornecer uma medida baseada na importância de determinados campos.
Exemplo
node = stream.create("autocluster", "My node")
node.setPropertyValue("ranking_measure", "Silhouette")
node.setPropertyValue("ranking_dataset", "Training")
node.setPropertyValue("enable_silhouette_limit", True)
node.setPropertyValue("silhouette_limit", 5)
Propriedades autoclusternode |
Valores | Descrição da propriedade |
|---|---|---|
evaluation |
campo | Nota: Apenas nó do Cluster automático. Identifica o campo para o qual um valor de importância será calculado. Como alternativa, pode ser usado para identificar quão bem o cluster diferencia o valor deste campo e, portanto, quão bem o modelo irá prever esse campo.
|
ranking_measure |
Silhouette Num_clusters Size_smallest_cluster Size_largest_cluster Smallest_to_largest Importance |
|
ranking_dataset |
Training Test |
|
summary_limit |
Número inteiro | Número de modelos para lista no relatório. Especifique um número inteiro entre 1 e 100. |
enable_silhouette_limit |
sinalização | |
silhouette_limit |
Número inteiro | Número inteiro entre 0 e 100. |
enable_number_less_limit |
sinalização | |
number_less_limit |
number | Número real entre 0,0 e 1,0. |
enable_number_greater_limit |
sinalização | |
number_greater_limit |
number | Integer maior que 0. |
enable_smallest_cluster_limit |
sinalização | |
smallest_cluster_units |
Percentage Counts |
|
smallest_cluster_limit_percentage |
number | |
smallest_cluster_limit_count |
Número inteiro | Integer maior que 0. |
enable_largest_cluster_limit |
sinalização | |
largest_cluster_units |
Percentage Counts |
|
largest_cluster_limit_percentage |
number | |
largest_cluster_limit_count |
Número inteiro | |
enable_smallest_largest_limit |
sinalização | |
smallest_largest_limit |
number | |
enable_importance_limit |
sinalização | |
importance_limit_condition |
Greater_than Less_than |
|
importance_limit_greater_than |
number | Número inteiro entre 0 e 100. |
importance_limit_less_than |
number | Número inteiro entre 0 e 100. |
<algorithm> |
sinalização | Ativa ou desativa o uso de um algoritmo específico. |
<algorithm>.<property> |
sequência | Configura um valor da propriedade para um algoritmo específico. Veja Configurando propriedades de algoritmo para obter mais informações. |
number_of_models |
Número inteiro | |
enable_model_build_time_limit |
Booleano | (Modelos K-médias, Kohonen, TwoStep, SVM, KNN, Rede bayesiana e Lista de decisão apenas.) Configura um limite máximo de tempo para qualquer modelo. Por exemplo, se um modelo específico requerer um longo tempo inesperado para treinar devido a alguma interação complexa, você provavelmente não vai querer que isso atrase toda a execução de modelagem. |
model_build_time_limit |
Número inteiro | Tempo gasto em construção de modelo. |
enable_stop_after_time_limit |
Booleano | (Modelos Rede neural, K-média, Kohonen, TwoStep, SVM, KNN, Rede bayesiana e C&R Tree apenas.) Interrompe uma execução após um número especificado de horas. Todos os modelos gerados até esse ponto serão incluídos no nugget do modelo, mas nenhum modelo adicional será produzido. |
stop_after_time_limit |
duplo | Limite de tempo de execução (horas). |
stop_if_valid_model |
Booleano | Interrompe uma execução quando um modelo passa todos os critérios especificados sob as configurações de Descarte. |