Nó numérico automático
O nó Numérico Automático estima e compara modelos para resultados de intervalo numérico contínuo usando vários métodos diferentes, permitindo que você experimente uma variedade de abordagens em uma única execução de modelagem. É possível selecionar os algoritmos para usar e experimentar várias combinações de opções. Por exemplo, você poderia prever valores de acomodação usando modelos de rede neural, regressão linear, C & RT e CHAID para ver qual é o melhor desempenho e você poderia experimentar diferentes combinações de métodos de regressão stepwise, forward e backward. O nó explora cada combinação possível de opções, classifica cada modelo candidato com base na medida especificada e salva o melhor para uso na pontuação ou análise adicional.
- Exemplo
- Um município quer estimar com mais precisão os impostos imobiliários e ajustar valores para propriedades específicas, conforme necessário, sem ter que inspecionar cada propriedade. Usando o nó Numeração Automática, o analista pode gerar e comparar vários modelos que preveem valores de propriedade com base no tipo de construção, ambiente, tamanho e outros fatores conhecidos.
- Requisitos
- Um único campo de destino (com a função configurada como Destino) e pelo menos um campo de entrada (com a função configurada como Entrada). A resposta deve ser um campo contínuo (intervalo numérico), como idade ou renda. Campos de entrada podem ser contínuos ou categóricos, com a limitação de que algumas entradas podem não ser apropriadas para alguns tipos de modelo. Por exemplo, os modelos de árvore C & R podem usar campos de sequência categórica como entradas, enquanto os modelos de regressão linear não podem usar esses campos e os ignorarão se especificados. Os requisitos são os mesmos que quando os nós de modelagem individuais são usados. Por exemplo, um modelo CHAID funciona da mesma forma se gerado a partir do nó CHAID ou do nó Numeração Automática.
- Campos de frequência e ponderação
- A frequência e o peso são usados para dar importância extra a alguns registros sobre outros porque, por exemplo, o usuário sabe que o conjunto de dados de construção representa uma seção da população pai (Peso) ou porque um registro representa um número de casos idênticos (Frequência). Se especificado, um campo de frequência pode ser usado pelos algoritmos C & R Tree e CHAID. Um campo de ponderação pode ser usado pelos algoritmos C & RT, CHAID, Regressão e GenLin .. Outros tipos de modelo irão ignorar esses campos e construir os modelos mesmo assim. Os campos de frequência e de ponderação são usados apenas para construção de modelo e não são considerados ao avaliar ou escorar modelos
- Prefixos
- Se você anexar um nó de tabela ao nugget para o Nó Numérico Automático, haverá várias novas variáveis na tabela com nomes que começam com um prefixo $
Tipos de Modelos Suportados
Os tipos de modelos compatíveis incluem Neural Net, C&R Tree, CHAID, Regression, GenLin, Nearest Neighbor, SVM, XGBoost Linear, GLE e XGBoost-AS.
Configurações de validação cruzada
Nas propriedades do nó, observe que configurações de validação cruzada estão disponíveis. A validação cruzada é uma técnica valiosa para testar a eficácia (evitando sobreajuste) de modelos de aprendizado de máquina, e também é um procedimento de nova amostragem que você pode usar para avaliar um modelo se você tiver dados limitados..
- Embaralhe o conjunto de dados aleatoriamente.
- Dividir o conjunto de dados em k-folds/grupos.
- Para cada dobra / grupo único:
- Pegue a dobra / grupo como uma suspensão ou conjunto de dados de teste.
- Use os grupos restantes como um conjunto de dados de treinamento
- Ajuste um modelo no conjunto de treinamento e avalie-o no conjunto de testes
- Retenha a pontuação de avaliação e descarte o modelo
- Sumarize a avaliação geral do modelo usando as pontuações de avaliação k-fold retidas
A validação cruzada é suportada atualmente por meio do nó Auto Classifier e do nó Auto Numeric. Clique duas vezes no nó para abrir suas propriedades. Selecionando a opção Validação cruzada , uma única partição de treinamento / teste é desativada e os nós Automáticos usarão a validação cruzada k-fold para avaliar o conjunto selecionado de algoritmos diferentes.
É possível especificar o Número de dobras (K). O padrão é 5, com um intervalo de 3 a 10 Se desejar manter a amostragem repetida durante a validação cruzada, para ter medidas de avaliação final consistentes para modelos gerados em diferentes execuções, é possível selecionar a opção Designação de partição de validação cruzada repetida . Também é possível configurar o Valor inicial aleatório para um valor específico para que o modelo resultante seja exatamente reproduzível. Ou clique em Gerar para sempre gerar a mesma seqüência de valores aleatórios, em cujo caso, a execução do nó sempre produz o mesmo modelo gerado
Aprendizado de máquina contínuo
Um inconveniente com a modelagem é os modelos ficarem desatualizados devido a mudanças em seus dados ao longo do tempo. Isso é comumente referido como desvio de modelo ou desvio de conceito Para ajudar a superar o desvio de modelo efetivamente, o SPSS Modeler fornece aprendizado de máquina automatizado contínuo. Esse recurso está disponível para os nuggets do modelo do nó Classificador Automático e do nó Numérico Automático Para obter mais informações, consulte Aprendiz de máquina contínua.