nó Classificador Automático
O nó Classificador Automático estima e compara modelos com respostas nominais (conjunto) ou binárias (sim/não) utilizando diversos métodos diferentes, permitindo experimentar uma variedade de abordagens em uma única execução de modelagem. É possível selecionar os algoritmos a serem utilizados e experimentar com diversas combinações de opções. Por exemplo, em vez de escolher entre Função de base radial, métodos polinomiais, sigmóides ou lineares para um SVM, você pode tentar todos eles. O nó explora cada combinação possível de opções, classifica cada modelo candidato com base na medida que você especificar e salva os melhores modelos para uso na escoragem ou análise adicional.
- Exemplo
- Uma empresa de varejo possui dados históricos que rastreiam as ofertas feitas para clientes específicos em campanhas passadas. A empresa agora quer alcançar resultados mais rentáveis, igualando a oferta adequada a cada cliente.
- Requisitos
- Um campo de destino com um nível de medição de
NominalouFlag(com o role set para Target), e pelo menos um campo de entrada (com o role set para Input). Para um campo de sinalizador, o valorTruedefinido para o destino é assumido para representar uma ocorrência ao calcular lucros, aumento e estatísticas relacionadas. Os campos de entrada podem ter um nível de medição deContinuousouCategorical, com a limitação de que alguns insumos podem não ser apropriados para alguns tipos de modelo. Por exemplo, os campos ordinais utilizados como entradas em modelos Árvore C&R, CHAID e QUEST devem ter armazenamento numérico (não sequência de caracteres) e serão ignorados por estes modelos se especificado de outra forma. Da mesma forma, os campos de entrada contínuos podem ser categorizados em alguns casos. Os requisitos são os mesmos de quando usar os nós de modelagem individuais; por exemplo, um modelo de rede Bayesiana funciona da mesma forma, seja gerado a partir do nó Rede Bayesiana ou do nó Classificador automático. - Campos de frequência e peso
- A frequência e a ponderação são utilizadas para dar importância extra para alguns registros sobre outros porque, por exemplo, quando o usuário sabe que o conjunto de dados de construção sub-representa uma parte da população pai (Ponderação) ou porque um registro representa um número de casos idênticos (Frequência). Se especificado, um campo de frequência poderá ser utilizado pelos modelos de Árvore C&R, CHAID, QUEST, Lista de Decisão e Rede Bayesiana. Um campo de ponderação pode ser utilizado pelos modelos C&RT, CHAID e C5.0 Outros tipos de modelo ignorarão esses campos e construirão os modelos de qualquer maneira. Os campos de frequência e de ponderação são utilizados apenas para construção de modelo e não são considerados ao avaliar ou escorar os modelos.
- Prefixos
- Se você anexar um nó de tabela ao nugget para o Nó Classificador Automático, haverá várias novas variáveis na tabela com nomes que começam com um prefixo $.
Tipos de modelos suportados
Os tipos de modelo suportados incluem Neural Net, C & R Tree, QUEST, CHAID, C5.0, Regressão Logística, Lista De Decisão, Bayes Net, Discriminante, Vizinho Mais Próximo, SVM, Árvore XGBoost e XGBoost-AS.
Configurações de validação cruzada
Nas propriedades do nó, observe que as configurações de validação cruzada estão disponíveis. A validação cruzada é uma técnica valiosa para testar a eficácia (evitando overfitting) de modelos de aprendizado de máquina e também é um procedimento de reamostragem que você pode usar para avaliar um modelo se tiver dados limitados.
- Ordene o conjunto de dados aleatoriamente.
- Divida o conjunto de dados em k-folds/grupos.
- Para cada dobra/grupo exclusivo:
- Considere a dobra/grupo como uma base ou conjunto de dados de teste.
- Considere os grupos restantes como um conjunto de dados de treinamento.
- Ajuste um modelo no conjunto de treinamento e avalie-o no conjunto de teste.
- Retenha a pontuação da avaliação e descarte o modelo.
- Resuma a avaliação geral do modelo usando as pontuações de avaliação de k-fold retidos.
A validação cruzada é atualmente suportada por meio do nó de classificador automático e do nó de numeração automática. Dê um clique duplo em um nó para configurar suas propriedades. Ao selecionar a opção de validação cruzada, uma única partição de trem/teste é desativada e os nós automáticos usarão a validação cruzada k-fold para avaliar o conjunto selecionado de algoritmos diferentes.
É possível especificar o Número de dobras (K). O padrão é 5, com uma faixa de 3 a 10. Se desejar reter a amostragem repetível durante a validação cruzada, para ter medidas de avaliação final consistentes para modelos gerados em diferentes execuções, você pode selecionar a opção de atribuição de partição de Validação Cruzada Repetível. Você também pode configurar o valor semente aleatória para um valor específico para que o modelo resultante seja exatamente reproduzível. Ou clique em Gerar para sempre gerar a mesma sequência de valores aleatórios; nesse caso, a execução do nó sempre resulta no mesmo modelo gerado.
Aprendizado de máquina contínuo
Uma inconveniência com a modelagem é a desatualização dos modelos devido a mudanças em seus dados ao longo do tempo. Isso normalmente é referido como desvio do modelo ou desvio de conceito. Para ajudar a superar o desvio do modelo de forma efetiva, o SPSS Modeler fornece o aprendizado de máquina automatizado contínuo. Este recurso está disponível para nuggets de modelo de nó de classificador automático e nó de numeração automática. Para obter mais informações, consulte Aprendiz de máquina contínua.