Automatizar a modelagem para um alvo de bandeira
Este tutorial usa o nó Auto Classifier para criar automaticamente e comparar vários modelos diferentes para metas de sinalização (como a probabilidade de um cliente específico ficar inadimplente em um empréstimo ou responder a uma determinada oferta) ou nominais (definidas).
Neste exemplo, você pesquisa um resultado de sinalização (sim ou não). Em um fluxo relativamente simples, o nó gera e classifica um conjunto de modelos candidatos, escolhe aqueles que têm o melhor desempenho e os combina em um único modelo agregado (combinado). Essa abordagem combina a facilidade de automação com os benefícios de combinar múltiplos modelos, que muitas vezes geram previsões mais precisas do que podem ser obtidas com qualquer modelo.
Este exemplo é baseado em uma empresa fictícia que deseja obter resultados mais rentáveis, correspondendo a oferta adequada a cada cliente. Essa abordagem enfatiza os benefícios da automação. Para obter um exemplo semelhante que usa um alvo contínuo (intervalo numérico), consulte os outros tutoriaisSPSS® Modeler.
Visualizando o tutorial
Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.
Experimente o tutorial
Neste tutorial, você concluirá estas tarefas:
Exemplo de fluxo do modelador e conjunto de dados
Este tutorial usa o fluxo " Modelagem automatizada para um alvo de bandeira no projeto de amostra. O arquivo de dados usado é pm_customer_train1.csv. A imagem a seguir mostra o fluxo do modelador de amostra.

Esse exemplo usa o arquivo de dados pm_customer_train1.csv, que contém dados históricos que rastreiam as ofertas feitas a clientes específicos em campanhas anteriores, conforme indicado pelo valor do campo " campaign.

Tarefa 1: Abrir o projeto de amostra
O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:
- Em Cloud Pak for Data no menu de navegação
, escolha Projetos > Exibir todos os projetos.
- Clique em SPSS Modeler Project.
- Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.
Verifique seu progresso
A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Tarefa 2: Examinar o nó Data Asset
A modelagem automatizada para um alvo de bandeira inclui vários nós. Siga estas etapas para examinar o nó Data Asset.
- Na guia Assets (Ativos ), abra o fluxo do modelador Automated Modeling for a Flag Target (Modelagem automatizada para um alvo de bandeira ) e aguarde o carregamento da tela.
- Clique duas vezes no nó pm_customer_train1.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo pm_customer_train1.csv no projeto.
- Revise as propriedades do formato do arquivo.
- Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.
O maior número de registros cai na campanha de conta premium. Os valores do campo "
campaignsão codificados como números inteiros nos dados (por exemplo, "2 = Premium account). Posteriormente, você define rótulos para esses valores que podem ser usados para gerar resultados mais significativos.O arquivo também inclui um campo "
responseque indica se a oferta foi aceita (0 = noe "1 = yes). O campo "responseé o campo de destino, ou valor, que você deseja prever. Vários campos contendo informações demográficas e financeiras sobre cada cliente também estão incluídos. Esses campos são usados para criar ou treinar um modelo que prevê taxas de resposta para indivíduos ou grupos com base em características como renda, idade ou número de transações por mês.
Verifique seu progresso
A imagem a seguir mostra o nó Data Asset. Agora você está pronto para editar o nó Type.

Tarefa 3: Editar o nó Type
Agora que você explorou o ativo de dados, siga estas etapas para visualizar e editar as propriedades do nó Type:
- Clique duas vezes no nó Type. Esse nó especifica as propriedades do campo, como o nível de medição (o tipo de dados que o campo contém) e a função de cada campo como alvo ou entrada na modelagem. O nível de medição é uma categoria que indica o tipo de dados no campo. O arquivo de dados de origem usa três níveis de medição diferentes:
- Um campo contínuo (como o campo "
Age) contém valores numéricos contínuos. - Um campo nominal (como o campo "
Education) tem dois ou mais valores distintos; nesse caso.Collegeou 'High school. - Um campo ordinal (como o campo "
Income level) descreve dados com vários valores distintos que têm uma ordem inerente; nesse caso, "Low, "Mediume "High.
- Um campo contínuo (como o campo "
- Verifique se o campo de resposta nº é o campo de destino (Função = Destino) e se a medida para esse campo é Sinalizador.
Figura 3. Definir o nível e a função de medição 
- Verifique se a função to está definida como None nos seguintes campos. Esses campos são ignorados quando você está construindo o modelo.
- customer_id
- campanha
- data_de_resposta
- compra
- data_da_compra
- product_id
- identificador de linha
- X_aleatório
- Clique em Read Values (Ler valores ) no nó Type (Tipo ) para garantir que os valores sejam instanciados.
Como você viu anteriormente, os dados de origem incluem informações sobre quatro campanhas diferentes, cada uma direcionada a um tipo diferente de conta de cliente. Essas campanhas são codificadas como números inteiros nos dados, portanto, para ajudar a lembrar que tipo de conta cada número inteiro representa, defina rótulos para cada um deles.
Figura 4. Escolha para especificar valores para um campo 
- Na linha # campaign (campanha) e na coluna Value Mode (modo de valor ), selecione Specify (especificar ) na lista.
- Clique no ícone Editar
na linha do campo # campaign (campanha ).
- Verifique os rótulos conforme mostrado para cada um dos quatro valores.
Figura 5. Definir rótulos para os valores de campo 
- Clique em OK. Agora, os rótulos são exibidos nas janelas de saída em vez dos números inteiros.
- Verifique os rótulos conforme mostrado para cada um dos quatro valores.
- Clique em Salvar.
- Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados com as propriedades Type (Tipo ) aplicadas.
Verifique seu progresso
A imagem a seguir mostra o nó Type. Agora você está pronto para selecionar uma campanha para analisar.

Tarefa 4: Selecione uma campanha para analisar
Embora os dados incluam informações sobre quatro campanhas diferentes, você concentra a análise em uma campanha de cada vez. Siga estas etapas para visualizar o nó Select para analisar apenas a campanha da conta Premium:
- Clique duas vezes no nó Select para visualizar suas propriedades.
- Observe a condição. Como o maior número de registros se enquadra na campanha da conta Premium (codificada como "
campaign=2nos dados), o nó Select seleciona apenas esses registros. - Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados com as propriedades Select aplicadas.
Verifique seu progresso
A imagem a seguir mostra o nó Select. Agora você está pronto para construir o modelo.

Tarefa 5: Criar o modelo
Agora que você selecionou uma única campanha para analisar, siga estas etapas para criar o modelo que usa o nó Auto Classifier:
- Clique duas vezes no nó Response (Auto Classifier) para visualizar suas propriedades.
- Expanda a seção Build Options.
- No campo Classificar modelos por, selecione Precisão geral como a métrica usada para classificar os modelos.
- Configure o número de modelos a serem usados como
3. Essa opção significa que os três melhores modelos são criados quando você executa o nó.Figura 6. Nó Classificador automático, opções de construção 
- Expanda a seção Expert para ver os diferentes algoritmos de modelagem.
- Desmarque os tipos de modelo Discriminant, SVM e Random Forest. Esses modelos levam mais tempo para serem treinados com esses dados, portanto, sua eliminação acelera o exemplo.
Como você definiu a propriedade Number of models to use como '
3em Build Options, o nó calcula a precisão dos algoritmos restantes e gera um único nugget de modelo contendo os três mais precisos.Figura 7. Nó Classificador automático, opções de especialistas 
- Nas opções de Ensemble, selecione Votação ponderada por confiança para o método de ensemble para Definir metas e Sinalizar metas. Essa configuração determina como uma única pontuação agregada é produzida para cada registro.
Com a votação simples, se dois de três modelos predizerem yes, então o yes ganha por uma votação de 2 a 1. No caso de votação com ponderação de confiança, os votos são ponderados com base no valor de confiança de cada predição. Assim, se um modelo prediz no com uma confiança mais alta do que as duas predições yes combinadas, então no vence.
Figura 8. Nó Classificador automático, opções de combinação 
- Clique em Salvar.
- Passe o mouse sobre o nó Resposta (Classificador Automático) e clique no ícone Executar
.
- No painel Outputs and models (Saídas e modelos ), clique no modelo com o nome response (resposta ) para visualizar os resultados. Você verá detalhes sobre cada um dos modelos criados durante a execução. (Em uma situação real, na qual centenas de modelos podem ser criados em um grande conjunto de dados, a execução do fluxo pode levar muitas horas)
- Clique em um nome de modelo para explorar qualquer um dos resultados de modelos individuais.
Por padrão, os modelos são classificados com base na precisão geral porque você selecionou essa medida nas propriedades do nó Auto Classifier. O modelo Árvore XGBoost se classifica melhor por esta medida, mas os modelos C5.0 e C&RT são quase tão precisos.
Com base nesses resultados, você decide usar todos os três desses modelos mais precisos. Ao combinar as previsões de vários modelos, as limitações dos modelos individuais podem ser evitadas, resultando em uma maior precisão geral.
- Na coluna USE, verifique se todos os três modelos estão funcionando e, em seguida, feche a janela do modelo.
Verifique seu progresso
A imagem a seguir mostra a tabela de comparação de modelos. Agora você está pronto para executar a análise do modelo.

Tarefa 6: Executar uma análise de modelo
Agora que você revisou os modelos gerados, siga estas etapas para executar uma análise dos modelos:
- Passe o mouse sobre o nó Analysis (Análise ) e clique no ícone Run (Executar )
.
- No painel Outputs and models (Saídas e modelos ), clique na saída Analysis (Análise ) para visualizar os resultados.
A pontuação agregada gerada pelo modelo agrupado é mostrada em um campo denominado "
$XF-response. Quando medido em relação aos dados de treinamento, o valor previsto corresponde à resposta real (conforme registrado no campo 'responseoriginal) com uma precisão geral de 92.77. Embora não seja tão preciso quanto o melhor dos três modelos individuais neste caso (92,82% para C5.0), a diferença é muito pequena para ser significativa. Em termos gerais, um modelo combinado normalmente terá mais probabilidade de ter um bom desempenho quando aplicado a conjuntos de dados diferentes dos dados de treinamento.
Verifique seu progresso
A imagem a seguir mostra a comparação de modelos que usa o nó Analysis.

Resumo
Com esse exemplo de fluxo " Modelagem automatizada para um alvo de bandeira, você usou o nó " Classificador automático para comparar vários modelos diferentes, usou os três modelos mais precisos e os adicionou ao fluxo dentro de um nugget de modelo do Auto Classifier agrupado.
- Com base na precisão geral, os modelos Árvore XGBoost, C5.0 e Árvore C&R tiveram melhor desempenho nos dados de treinamento.
- O modelo combinado teve um desempenho quase tão bom quanto o melhor dos modelos individuais e pode ter um desempenho melhor quando aplicado a outros conjuntos de dados. Se sua meta é automatizar o processo o máximo possível, essa abordagem ajuda a obter um modelo robusto na maioria das circunstâncias, sem precisar se aprofundar nas especificidades de cada modelo.
Próximas etapas
Agora você está pronto para experimentar outros tutoriais do SPSS Modeler.