Prever a rotatividade das telecomunicações

Este tutorial cria um modelo de regressão logística, que é uma técnica estatística para classificar registros com base nos valores dos campos de entrada. É análogo à regressão linear, mas usa um campo de destino categórico em vez de um campo numérico.

Por exemplo, suponha que um provedor de telecomunicações esteja preocupado com o número de clientes que está perdendo para os concorrentes. Se os dados de uso do serviço puderem ser usados para prever quais clientes estão sujeitos a transferência para outro provedor, as ofertas podem ser personalizadas para reter o maior número possível de clientes.

Visualizando o tutorial

Assistir vídeo Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.

Experimente o tutorial

Neste tutorial, você concluirá estas tarefas:

Exemplo de fluxo do modelador e conjunto de dados

Este tutorial usa o fluxo Telecommunications Churn no projeto de amostra. O arquivo de dados usado é telco.csv. A imagem a seguir mostra o fluxo do modelador de amostra.

Figura 1. Fluxo do modelador de amostras
Fluxo do modelador de amostras

Este exemplo se concentra no uso de dados de uso para prever a perda de clientes (rotatividade). Como o destino tem duas categorias distintas, um modelo binomial é usado. Se o alvo tiver várias categorias, poderá ser criado um modelo multinomial.

A imagem a seguir mostra o conjunto de dados usado com esse fluxo do modelador.

Figura 2 Conjunto de dados de amostra
Conjunto de dados de amostra

Tarefa 1: Abrir o projeto de amostra

O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:

  1. Em Cloud Pak for Data no menu de navegação Menu de Navegação, escolha Projetos > Exibir todos os projetos.
  2. Clique em SPSS Modeler Project.
  3. Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Projeto de amostra

de volta para a parte superior

Tarefa 2: Examinar o nó Data Asset e Type

A rotatividade das telecomunicações inclui vários nós. Siga estas etapas para examinar os nós Data Asset e Type:

  1. Na guia Assets (Ativos ), abra o fluxo do modelador Telecommunication Churn e aguarde o carregamento da tela.
  2. Clique duas vezes no nó telco.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo telco.csv no projeto.
  3. Revise as propriedades do formato do arquivo.
  4. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.
  5. Clique duas vezes no nó Type. Esse nó especifica as propriedades do campo, como o nível de medição (o tipo de dados que o campo contém) e a função de cada campo como alvo ou entrada na modelagem. Certifique-se de que todos os níveis de medição estejam definidos corretamente. Por exemplo, a maioria dos campos com valores de " 0.0 e " 1.0 pode ser considerada como sinalizadores, mas alguns campos, como gênero, são vistos com mais precisão como um campo nominal com dois valores.
    Figura 3. Níveis de medição
    Níveis de medição

    Observe que " churn está definido como um sinalizador com uma função de destino. A função de todos os outros campos é definida como Input.
  6. Clique duas vezes no nó de modelagem churn (Seleção de recursos) para ver suas propriedades. Você pode usar um nó Feature Selection para remover preditores ou dados que não acrescentam nenhuma informação útil sobre a relação preditor/destino.
  7. Passe o mouse sobre o nó churn (Seleção de recursos) e clique no ícone ExecutarÍcone de execução.
  8. No painel Outputs and models (Saídas e modelos ), clique no primeiro modelo da lista com o nome churn para exibir os detalhes do modelo.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra os detalhes do modelo. Agora você está pronto para verificar o nó Filter.

Visualizar modelo: churn

de volta para a parte superior

Tarefa 3: Verificar o nó Filter

Apenas alguns dos dados no arquivo de dados telco.csv são úteis para prever a rotatividade. Você pode usar o filtro para selecionar apenas os dados que são considerados importantes para uso como preditor (os campos marcados como Importante no modelo gerado na tarefa anterior). Siga estas etapas para ver e verificar o nó Filter:

  1. Clique duas vezes no nó Important Features (Filter) para ver suas propriedades.
    1. Observe que esse nó filtra apenas os campos selecionados: ' tenure, ' age, ' address, ' income, ' ed, ' employ, entre outros. Outros campos são excluídos desta análise.
      Figura 4. Recursos importantes do nó de filtro
      Recursos importantes do nó de filtro
    2. Clique em Cancelar.
  2. Clique duas vezes no nó de saída 28 Fields (Data Audit) após o nó Filter.
    1. Passe o mouse sobre o nó Data Audit e clique no ícone Run (Executar ) Ícone de execução.
    2. No painel Outputs and models (Saídas e modelos ), clique nos resultados com o nome Data Audit (Auditoria de dados ) para visualizar a saída.
    3. Observe a coluna % Complete, que pode ser usada para identificar quaisquer campos com grandes quantidades de dados ausentes. Nesse caso, o único campo que você precisa alterar é logtoll, que está menos de 50% concluído.
      Figura 5. 28 Saída de campos
      28 Saída de campos
    4. Feche a saída.
  3. Clique duas vezes no supernó Imputação de valores ausentes.
    1. Clique em Exibir supernó.
    2. Clique duas vezes no nó Fill logtoll (Filler).

      Os nós de preenchimento são usados para substituir valores de campo e alterar o armazenamento. É possível optar por substituir os valores com base em uma condição do CLEM especificada, como @BLANK(FIELD). Como alternativa, é possível optar por substituir todos os valores em branco ou nulos por um valor específico. Os nós de preenchimento são frequentemente usados com o nó Type para substituir valores ausentes.

      Na seção Preencher campos, é possível especificar os campos do conjunto de dados cujos valores você deseja examinar e substituir. Nesse caso, a coluna " logtoll é especificada junto com uma opção de valores em branco e nulos na seção Substituir.

      Figura 6. Supernó de imputação de valor ausente com propriedades de preenchimento
      Supernó de imputação de valor ausente com propriedades de preenchimento
    3. Clique em Retornar ao fluxo anterior.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o fluxo. Agora você está pronto para construir o modelo.

Propriedades do Super Nó

de volta para a parte superior

Tarefa 4: Criar o modelo

Você cria um modelo que usa o nó Logistic. Siga estas etapas para criar o modelo:

  1. Clique duas vezes no nó churn (Logistic), após o supernó Missing Value Imputation, para exibir suas propriedades.
  2. Na seção Model Settings (Configurações do modelo ), selecione o procedimento Binomial.
    • Um modelo binomial é usado quando o campo de destino é um sinalizador ou campo nominal com dois valores discretos.
    • Um modelo multinomial é usado quando o campo de destino é um campo nominal com mais de dois valores.
  3. Em seguida, selecione o método Forwards Stepwise.
  4. Na seção Expert Options, selecione o modo Expert.
  5. Clique em Output. Selecione Em cada etapa, Histórico de iteração e Estimativas de parâmetro e, em seguida, clique em OK.
    Figura 7. Opções de nó logístico
    Opções de nó logístico

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o fluxo. Agora você está pronto para gerar o modelo.

nó Logística

de volta para a parte superior

Tarefa 5: Gerar o modelo

Siga estas etapas para gerar um nugget de modelo a partir do nó Logistic :

  1. Passe o mouse sobre o nó churn (Logística) e clique no ícone ExecutarÍcone de execução.
  2. No painel Outputs and models (Saídas e modelos ), clique no modelo de rotatividade para visualizar os resultados.

A página Variables in the Equation (Variáveis na equação ) mostra o alvo (rotatividade) e as entradas (campos de previsão) usados pelo modelo. Esses campos são escolhidos com base no método Forwards Stepwise, e não na lista completa enviada para consideração.

Para avaliar o grau de adequação do modelo aos seus dados, vários diagnósticos estão disponíveis nas configurações do nó especialista quando você está criando o fluxo.

Observe também que esses resultados são baseados apenas nos dados de treinamento. Para avaliar o grau de generalização do modelo para outros dados no mundo real, use um nó Partition para manter um subconjunto de registros para fins de teste e validação.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra os resultados do modelo.

Figura 8. Variáveis do modelo na tabela de equações
Variáveis do modelo na tabela de equações

de volta para a parte superior

Resumo

Este exemplo mostrou como usar os dados de uso para prever a perda de clientes (churn) criando um modelo binomial porque o alvo tem duas categorias distintas.

Próximas etapas

Agora você está pronto para experimentar outros tutoriais do SPSS® Modeler.