Automatizar a modelagem para um alvo de bandeira

Este tutorial usa o nó Auto Classifier para criar automaticamente e comparar vários modelos diferentes para metas de sinalização (como a probabilidade de um cliente específico ficar inadimplente em um empréstimo ou responder a uma determinada oferta) ou nominais (definidas).

Neste exemplo, você pesquisa um resultado de sinalização (sim ou não). Em um fluxo relativamente simples, o nó gera e classifica um conjunto de modelos candidatos, escolhe aqueles que têm o melhor desempenho e os combina em um único modelo agregado (combinado). Essa abordagem combina a facilidade de automação com os benefícios de combinar múltiplos modelos, que muitas vezes geram previsões mais precisas do que podem ser obtidas com qualquer modelo.

Este exemplo é baseado em uma empresa fictícia que deseja obter resultados mais rentáveis, correspondendo a oferta adequada a cada cliente. Essa abordagem enfatiza os benefícios da automação. Para obter um exemplo semelhante que usa um alvo contínuo (intervalo numérico), consulte os outros tutoriaisSPSS® Modeler.

Visualizando o tutorial

Assistir vídeo Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.

Experimente o tutorial

Neste tutorial, você concluirá estas tarefas:

Exemplo de fluxo do modelador e conjunto de dados

Este tutorial usa o fluxo " Modelagem automatizada para um alvo de bandeira no projeto de amostra. O arquivo de dados usado é pm_customer_train1.csv. A imagem a seguir mostra o fluxo do modelador de amostra.

Figura 1. Fluxo do modelador de amostras
Fluxo de exemplo do classificador automático

Esse exemplo usa o arquivo de dados pm_customer_train1.csv, que contém dados históricos que rastreiam as ofertas feitas a clientes específicos em campanhas anteriores, conforme indicado pelo valor do campo " campaign.

A imagem a seguir mostra o conjunto de dados de amostra.
Figura 2 Conjunto de dados de amostra
Dados sobre promoções anteriores

Tarefa 1: Abrir o projeto de amostra

O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:

  1. Em Cloud Pak for Data no menu de navegação Menu de Navegação, escolha Projetos > Exibir todos os projetos.
  2. Clique em SPSS Modeler Project.
  3. Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Projeto de amostra

de volta para a parte superior

Tarefa 2: Examinar o nó Data Asset

A modelagem automatizada para um alvo de bandeira inclui vários nós. Siga estas etapas para examinar o nó Data Asset.

  1. Na guia Assets (Ativos ), abra o fluxo do modelador Automated Modeling for a Flag Target (Modelagem automatizada para um alvo de bandeira ) e aguarde o carregamento da tela.
  2. Clique duas vezes no nó pm_customer_train1.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo pm_customer_train1.csv no projeto.
  3. Revise as propriedades do formato do arquivo.
  4. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.

    O maior número de registros cai na campanha de conta premium. Os valores do campo " campaign são codificados como números inteiros nos dados (por exemplo, " 2 = Premium account). Posteriormente, você define rótulos para esses valores que podem ser usados para gerar resultados mais significativos.

    O arquivo também inclui um campo " response que indica se a oferta foi aceita (0 = no e " 1 = yes). O campo " response é o campo de destino, ou valor, que você deseja prever. Vários campos contendo informações demográficas e financeiras sobre cada cliente também estão incluídos. Esses campos são usados para criar ou treinar um modelo que prevê taxas de resposta para indivíduos ou grupos com base em características como renda, idade ou número de transações por mês.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Data Asset. Agora você está pronto para editar o nó Type.

Nó de ativo de dados

de volta para a parte superior

Tarefa 3: Editar o nó Type

Agora que você explorou o ativo de dados, siga estas etapas para visualizar e editar as propriedades do nó Type:

  1. Clique duas vezes no nó Type. Esse nó especifica as propriedades do campo, como o nível de medição (o tipo de dados que o campo contém) e a função de cada campo como alvo ou entrada na modelagem. O nível de medição é uma categoria que indica o tipo de dados no campo. O arquivo de dados de origem usa três níveis de medição diferentes:
    • Um campo contínuo (como o campo " Age ) contém valores numéricos contínuos.
    • Um campo nominal (como o campo " Education ) tem dois ou mais valores distintos; nesse caso. College ou ' High school.
    • Um campo ordinal (como o campo " Income level ) descreve dados com vários valores distintos que têm uma ordem inerente; nesse caso, " Low, " Medium e " High.
  2. Verifique se o campo de resposta nº é o campo de destino (Função = Destino) e se a medida para esse campo é Sinalizador.
    Figura 3. Definir o nível e a função de medição
    Definir o nível e a função de medição
  3. Verifique se a função to está definida como None nos seguintes campos. Esses campos são ignorados quando você está construindo o modelo.
    • customer_id
    • campanha
    • data_de_resposta
    • compra
    • data_da_compra
    • product_id
    • identificador de linha
    • X_aleatório
  4. Clique em Read Values (Ler valores ) no nó Type (Tipo ) para garantir que os valores sejam instanciados.

    Como você viu anteriormente, os dados de origem incluem informações sobre quatro campanhas diferentes, cada uma direcionada a um tipo diferente de conta de cliente. Essas campanhas são codificadas como números inteiros nos dados, portanto, para ajudar a lembrar que tipo de conta cada número inteiro representa, defina rótulos para cada um deles.

    Figura 4. Escolha para especificar valores para um campo
    Escolha para especificar valores para um campo
  5. Na linha # campaign (campanha) e na coluna Value Mode (modo de valor ), selecione Specify (especificar ) na lista.
  6. Clique no ícone Editar Ícone de edição na linha do campo # campaign (campanha ).
    1. Verifique os rótulos conforme mostrado para cada um dos quatro valores.
      Figura 5. Definir rótulos para os valores de campo
      Definir rótulos para os valores de campo
    2. Clique em OK. Agora, os rótulos são exibidos nas janelas de saída em vez dos números inteiros.
  7. Clique em Salvar.
  8. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados com as propriedades Type (Tipo ) aplicadas.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Type. Agora você está pronto para selecionar uma campanha para analisar.

nó Tipo

de volta para a parte superior

Tarefa 4: Selecione uma campanha para analisar

Embora os dados incluam informações sobre quatro campanhas diferentes, você concentra a análise em uma campanha de cada vez. Siga estas etapas para visualizar o nó Select para analisar apenas a campanha da conta Premium:

  1. Clique duas vezes no nó Select para visualizar suas propriedades.
  2. Observe a condição. Como o maior número de registros se enquadra na campanha da conta Premium (codificada como " campaign=2 nos dados), o nó Select seleciona apenas esses registros.
  3. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados com as propriedades Select aplicadas.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Select. Agora você está pronto para construir o modelo.

Selecionar nó

de volta para a parte superior

Tarefa 5: Criar o modelo

Agora que você selecionou uma única campanha para analisar, siga estas etapas para criar o modelo que usa o nó Auto Classifier:

  1. Clique duas vezes no nó Response (Auto Classifier) para visualizar suas propriedades.
  2. Expanda a seção Build Options.
  3. No campo Classificar modelos por, selecione Precisão geral como a métrica usada para classificar os modelos.
  4. Configure o número de modelos a serem usados como 3. Essa opção significa que os três melhores modelos são criados quando você executa o nó.
    Figura 6. Nó Classificador automático, opções de construção
    Nó Classificador automático, opções de construção
  5. Expanda a seção Expert para ver os diferentes algoritmos de modelagem.
  6. Desmarque os tipos de modelo Discriminant, SVM e Random Forest. Esses modelos levam mais tempo para serem treinados com esses dados, portanto, sua eliminação acelera o exemplo.

    Como você definiu a propriedade Number of models to use como ' 3 em Build Options, o nó calcula a precisão dos algoritmos restantes e gera um único nugget de modelo contendo os três mais precisos.

    Figura 7. Nó Classificador automático, opções de especialistas
    Nó Classificador automático, opções de especialistas
  7. Nas opções de Ensemble, selecione Votação ponderada por confiança para o método de ensemble para Definir metas e Sinalizar metas. Essa configuração determina como uma única pontuação agregada é produzida para cada registro.

    Com a votação simples, se dois de três modelos predizerem yes, então o yes ganha por uma votação de 2 a 1. No caso de votação com ponderação de confiança, os votos são ponderados com base no valor de confiança de cada predição. Assim, se um modelo prediz no com uma confiança mais alta do que as duas predições yes combinadas, então no vence.

    Figura 8. Nó Classificador automático, opções de combinação
    Nó Classificador automático, opções de combinação
  8. Clique em Salvar.
  9. Passe o mouse sobre o nó Resposta (Classificador Automático) e clique no ícone ExecutarÍcone de execução.
  10. No painel Outputs and models (Saídas e modelos ), clique no modelo com o nome response (resposta ) para visualizar os resultados. Você verá detalhes sobre cada um dos modelos criados durante a execução. (Em uma situação real, na qual centenas de modelos podem ser criados em um grande conjunto de dados, a execução do fluxo pode levar muitas horas)
  11. Clique em um nome de modelo para explorar qualquer um dos resultados de modelos individuais.

    Por padrão, os modelos são classificados com base na precisão geral porque você selecionou essa medida nas propriedades do nó Auto Classifier. O modelo Árvore XGBoost se classifica melhor por esta medida, mas os modelos C5.0 e C&RT são quase tão precisos.

    Com base nesses resultados, você decide usar todos os três desses modelos mais precisos. Ao combinar as previsões de vários modelos, as limitações dos modelos individuais podem ser evitadas, resultando em uma maior precisão geral.

  12. Na coluna USE, verifique se todos os três modelos estão funcionando e, em seguida, feche a janela do modelo.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra a tabela de comparação de modelos. Agora você está pronto para executar a análise do modelo.

Modelo de visualização: resposta

de volta para a parte superior

Tarefa 6: Executar uma análise de modelo

Agora que você revisou os modelos gerados, siga estas etapas para executar uma análise dos modelos:

  1. Passe o mouse sobre o nó Analysis (Análise ) e clique no ícone Run (Executar ) Ícone de execução.
  2. No painel Outputs and models (Saídas e modelos ), clique na saída Analysis (Análise ) para visualizar os resultados.

    A pontuação agregada gerada pelo modelo agrupado é mostrada em um campo denominado " $XF-response. Quando medido em relação aos dados de treinamento, o valor previsto corresponde à resposta real (conforme registrado no campo ' response original) com uma precisão geral de 92.77. Embora não seja tão preciso quanto o melhor dos três modelos individuais neste caso (92,82% para C5.0), a diferença é muito pequena para ser significativa. Em termos gerais, um modelo combinado normalmente terá mais probabilidade de ter um bom desempenho quando aplicado a conjuntos de dados diferentes dos dados de treinamento.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra a comparação de modelos que usa o nó Analysis.

Nó de Análise

de volta para a parte superior

Resumo

Com esse exemplo de fluxo " Modelagem automatizada para um alvo de bandeira, você usou o nó " Classificador automático para comparar vários modelos diferentes, usou os três modelos mais precisos e os adicionou ao fluxo dentro de um nugget de modelo do Auto Classifier agrupado.

  • Com base na precisão geral, os modelos Árvore XGBoost, C5.0 e Árvore C&R tiveram melhor desempenho nos dados de treinamento.
  • O modelo combinado teve um desempenho quase tão bom quanto o melhor dos modelos individuais e pode ter um desempenho melhor quando aplicado a outros conjuntos de dados. Se sua meta é automatizar o processo o máximo possível, essa abordagem ajuda a obter um modelo robusto na maioria das circunstâncias, sem precisar se aprofundar nas especificidades de cada modelo.

Próximas etapas

Agora você está pronto para experimentar outros tutoriais do SPSS Modeler.