Propriedades de twostepnode
O nó TwoStep usa um método de clusterização em dois passos. O primeiro passo faz uma simples passagem pelos dados para compactar os dados de entrada brutos em um conjunto gerenciável de subclusters. O segundo passo usa um método de armazenamento em cluster hierárquico para mesclar progressivamente os subclusters em clusters cada vez maiores. TwoStep tem a vantagem de estimar automaticamente o número ideal de clusters para dados de treinamento. Ele pode manipular tipos mistos de campos e conjuntos grandes de dados de forma eficiente.
Exemplo
node = stream.create("twostep", "My node")
node.setPropertyValue("custom_fields", True)
node.setPropertyValue("inputs", ["Age", "K", "Na", "BP"])
node.setPropertyValue("partition", "Test")
node.setPropertyValue("use_model_name", False)
node.setPropertyValue("model_name", "TwoStep_Drug")
node.setPropertyValue("use_partitioned_data", True)
node.setPropertyValue("exclude_outliers", True)
node.setPropertyValue("cluster_label", "String")
node.setPropertyValue("label_prefix", "TwoStep_")
node.setPropertyValue("cluster_num_auto", False)
node.setPropertyValue("max_num_clusters", 9)
node.setPropertyValue("min_num_clusters", 3)
node.setPropertyValue("num_clusters", 7)
Propriedades twostepnode |
Valores | Descrição da propriedade |
|---|---|---|
inputs |
[field1 ... fieldN] | Os modelos de TwoStep utilizam uma lista de campos de entrada, mas não de destino. Os campos de peso e de frequência não são reconhecidos. Veja Propriedades do nó de modelagem comum para obter mais informações. |
standardize |
sinalização | |
exclude_outliers |
sinalização | |
percentage |
number | |
cluster_num_auto |
sinalização | |
min_num_clusters |
number | |
max_num_clusters |
number | |
num_clusters |
number | |
cluster_label |
String Number |
|
label_prefix |
sequência | |
distance_measure |
Euclidean Loglikelihood |
|
clustering_criterion |
AIC BIC |