Nó de cluster TwoStep
O nó de cluster TwoStep fornece uma forma de análise de cluster. Ele pode ser usado para agrupar o conjunto de dados em grupos distintos quando você não souber quais desses grupos estão no início. Assim como os nós Kohonen e os nós K-Médias, os modelos de cluster TwoStep não utilizam um campo de destino. Em vez de tentar prever um resultado, o Cluster TwoStep tenta descobrir padrões no conjunto de campos de entrada. Os registros são agrupados de modo que os registros em um grupo ou cluster tendem a ser semelhantes entre si, mas os registros em grupos diferentes são diferentes.
O Cluster TwoStep é um método de clusterização em dois passos O primeiro passo faz uma simples passagem pelos dados, quando ele compacta os dados de entrada brutos em um conjunto gerenciável de subclusters. O segundo passo usa um método de armazenamento em cluster hierárquico para mesclar progressivamente os subclusters em clusters cada vez maiores, sem requerer passar novamente pelos dados. O armazenamento em cluster hierárquico tem a vantagem de não requerer selecionar o número de clusters antes do tempo. Muitos métodos de armazenamento em cluster hierárquicos iniciam com registros individuais como clusters individuais e mesclam esses registros recursivamente para produzir clusters ainda maiores. Embora essas abordagens normalmente manipulam enormes quantias de dados, o pré-armazenamento em cluster inicial do TwoStep torna o armazenamento em cluster hierárquico rápido até mesmo para conjuntos de dados grandes.
Requisitos. Para treinar um modelo de Cluster TwoStep , você precisa de um ou mais campos com a função configurada como Input Campos com a função definida como Target, Bothou None são ignorados. O algoritmo de Cluster TwoStep não manipula valores omissos. Os registros com espaços em branco para qualquer um dos campos de entrada serão ignorados durante a construção do modelo.
Fortes. O Cluster TwoStep pode manipular tipos de campo combinados e manipular grandes conjuntos de dados de maneira eficiente. Ele também tem a capacidade de testar várias soluções de cluster e escolher a melhor, de modo que você não precisa saber quantos clusters solicitar no início. O cluster TwoStep pode ser configurado para excluir automaticamente valores discrepantes ou casos extremamente incomuns que podem contaminar seus resultados.