Nó numérico automático

O nó Numérico Automático estima e compara modelos para resultados de intervalo numérico contínuo usando vários métodos diferentes, permitindo que você experimente uma variedade de abordagens em uma única execução de modelagem. É possível selecionar os algoritmos para usar e experimentar várias combinações de opções. Por exemplo, você poderia prever valores de acomodação usando modelos de rede neural, regressão linear, C & RT e CHAID para ver qual é o melhor desempenho e você poderia experimentar diferentes combinações de métodos de regressão stepwise, forward e backward. O nó explora cada combinação possível de opções, classifica cada modelo candidato com base na medida especificada e salva o melhor para uso na pontuação ou análise adicional.

Exemplo
Um município quer estimar com mais precisão os impostos imobiliários e ajustar valores para propriedades específicas, conforme necessário, sem ter que inspecionar cada propriedade. Usando o nó Numeração Automática, o analista pode gerar e comparar vários modelos que preveem valores de propriedade com base no tipo de construção, ambiente, tamanho e outros fatores conhecidos.
Requisitos
Um único campo de destino (com a função configurada como Destino) e pelo menos um campo de entrada (com a função configurada como Entrada). A resposta deve ser um campo contínuo (intervalo numérico), como idade ou renda. Campos de entrada podem ser contínuos ou categóricos, com a limitação de que algumas entradas podem não ser apropriadas para alguns tipos de modelo. Por exemplo, os modelos de árvore C & R podem usar campos de sequência categórica como entradas, enquanto os modelos de regressão linear não podem usar esses campos e os ignorarão se especificados. Os requisitos são os mesmos que quando os nós de modelagem individuais são usados. Por exemplo, um modelo CHAID funciona da mesma forma se gerado a partir do nó CHAID ou do nó Numeração Automática.
Campos de frequência e ponderação
A frequência e o peso são usados para dar importância extra a alguns registros sobre outros porque, por exemplo, o usuário sabe que o conjunto de dados de construção representa uma seção da população pai (Peso) ou porque um registro representa um número de casos idênticos (Frequência). Se especificado, um campo de frequência pode ser usado pelos algoritmos C & R Tree e CHAID. Um campo de ponderação pode ser usado pelos algoritmos C & RT, CHAID, Regressão e GenLin .. Outros tipos de modelo irão ignorar esses campos e construir os modelos mesmo assim. Os campos de frequência e de ponderação são usados apenas para construção de modelo e não são considerados ao avaliar ou escorar modelos
Prefixos
Se você anexar um nó de tabela ao nugget para o Nó Numérico Automático, haverá várias novas variáveis na tabela com nomes que começam com um prefixo $
Os nomes dos campos que são gerados durante a pontuação são baseados no campo de destino, mas com um prefixo padrão. Diferentes tipos de modelo usam diferentes conjuntos de prefixos...
Por exemplo, os prefixos $G, $R, $C são usados como o prefixo para predições que são geradas pelo modelo Linear Generalizado, modelo CHAID e modelo C5.0 , respectivamente. $X é geralmente gerado usando uma combinação, e $XR, $XS e $XF são usados como prefixos em casos em que o campo de destino é um campo Contínuo, Categórico ou Flag, respectivamente.
$..Prefixos E são usados para a confiança de predição de um destino Contínuo; por exemplo, $XRE é usado como um prefixo para combinação de confiança de predição Contínuo. $GE é o prefixo para uma única predição de confiança para um modelo Linear Generalizado.

Tipos de Modelos Suportados

Os tipos de modelos compatíveis incluem Neural Net, C&R Tree, CHAID, Regression, GenLin, Nearest Neighbor, SVM, XGBoost Linear, GLE e XGBoost-AS.

Configurações de validação cruzada

Nas propriedades do nó, observe que configurações de validação cruzada estão disponíveis. A validação cruzada é uma técnica valiosa para testar a eficácia (evitando sobreajuste) de modelos de aprendizado de máquina, e também é um procedimento de nova amostragem que você pode usar para avaliar um modelo se você tiver dados limitados..

K-fold é uma maneira popular e fácil de executar validação cruzada. Geralmente resulta em um modelo menos enviesado em comparação com uma única partição de trem / teste, porque garante que cada observação do conjunto de dados original tenha a chance de aparecer em conjuntos de treinamento e teste. O procedimento geral de validação cruzada de k-fold é o seguinte.
Nota: Modelagem automática paralela no modo de validação cruzada (rodando dois ou mais nós de modelagem automática ao mesmo tempo, como através do botão Executar tudo ) não é suportado neste momento. Como uma solução alternativa, você pode executar cada nó de modelagem automática (com validação cruzada ativada, que é desativada por padrão) uma de cada vez.
  1. Embaralhe o conjunto de dados aleatoriamente.
  2. Dividir o conjunto de dados em k-folds/grupos.
  3. Para cada dobra / grupo único:
    1. Pegue a dobra / grupo como uma suspensão ou conjunto de dados de teste.
    2. Use os grupos restantes como um conjunto de dados de treinamento
    3. Ajuste um modelo no conjunto de treinamento e avalie-o no conjunto de testes
    4. Retenha a pontuação de avaliação e descarte o modelo
  4. Sumarize a avaliação geral do modelo usando as pontuações de avaliação k-fold retidas

A validação cruzada é suportada atualmente por meio do nó Auto Classifier e do nó Auto Numeric. Clique duas vezes no nó para abrir suas propriedades. Selecionando a opção Validação cruzada , uma única partição de treinamento / teste é desativada e os nós Automáticos usarão a validação cruzada k-fold para avaliar o conjunto selecionado de algoritmos diferentes.

É possível especificar o Número de dobras (K). O padrão é 5, com um intervalo de 3 a 10 Se desejar manter a amostragem repetida durante a validação cruzada, para ter medidas de avaliação final consistentes para modelos gerados em diferentes execuções, é possível selecionar a opção Designação de partição de validação cruzada repetida . Também é possível configurar o Valor inicial aleatório para um valor específico para que o modelo resultante seja exatamente reproduzível. Ou clique em Gerar para sempre gerar a mesma seqüência de valores aleatórios, em cujo caso, a execução do nó sempre produz o mesmo modelo gerado

Aprendizado de máquina contínuo

Um inconveniente com a modelagem é os modelos ficarem desatualizados devido a mudanças em seus dados ao longo do tempo. Isso é comumente referido como desvio de modelo ou desvio de conceito Para ajudar a superar o desvio de modelo efetivamente, o SPSS Modeler fornece aprendizado de máquina automatizado contínuo. Esse recurso está disponível para os nuggets do modelo do nó Classificador Automático e do nó Numérico Automático Para obter mais informações, consulte Aprendiz de máquina contínua.