Preditores de tela

Este tutorial usa o nó Feature Selection para ajudá-lo a identificar os campos mais importantes na previsão de um determinado resultado. A partir de um conjunto de centenas ou até milhares de preditores, o nó Seleção de recursos examina, classifica e seleciona os preditores que podem ser mais importantes. Por fim, você pode acabar com um modelo mais rápido e eficiente, que usa menos preditores, é executado mais rapidamente e pode ser mais fácil de entender.

Visualizando o tutorial

Assistir vídeo Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.

Experimente o tutorial

Neste tutorial, você concluirá estas tarefas:

Exemplo de fluxo de modelador e conjunto de dados

Este tutorial usa o fluxo Screening Predictors no projeto de amostra. O arquivo de dados usado é customer_dbase.csv. A imagem a seguir mostra o fluxo do modelador de amostra.

Figura 1. Fluxo do modelador de amostras
Fluxo de exemplo de seleção de recursos
Este exemplo se concentra em apenas uma das ofertas como destino. Ele usa o nó de construção de árvore CHAID para desenvolver um modelo para descrever quais clientes têm maior probabilidade de responder à promoção. Ele contrasta duas abordagens:
  • Sem seleção de recurso. Todos os campos preditores no conjunto de dados são usados como entradas para a árvore CHAID.
  • Com seleção de recurso. O nó Seleção de recursos é usado para selecionar os 10 melhores preditores. Esses preditores são inseridos na árvore CHAID.

Ao comparar os dois modelos de árvore resultantes, você pode ver como a seleção de recursos pode produzir resultados eficazes.

A imagem a seguir mostra o conjunto de dados de amostra.
Figura 2 Conjunto de dados de amostra
Conjunto de dados de amostra

Tarefa 1: Abrir o projeto de amostra

O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:

  1. Em Cloud Pak for Data no menu de navegação Menu de Navegação, escolha Projetos > Exibir todos os projetos.
  2. Clique em SPSS Modeler Project.
  3. Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Projeto de amostra

de volta para a parte superior

Tarefa 2: Examinar os nós Data Asset e Type

O Screening Predictors inclui vários nós. Siga estas etapas para examinar os nós Data Asset e Type:

  1. Na guia Assets (Ativos ), abra o fluxo do modelador Screening Predictors e aguarde o carregamento da tela.
  2. Clique duas vezes no nó customer_dbase.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo customer_dbase.csv no projeto.
  3. Revise as propriedades do formato do arquivo.
  4. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.
  5. Clique duas vezes no nó Type. Observe o valor de Role para cada um desses campos:
    • response_01 é definido como Target
    • response_02, response_03 e custid são definidos como None
    • Todos os outros campos são definidos como Input
    Figura 3. Níveis de medição do nó de tipo
    nó Tipo
  6. Clique em Ler valores.
  7. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados com as propriedades Type (Tipo ) aplicadas.
  8. Clique em Salvar.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Type. Agora você está pronto para construir o modelo.

nó Tipo

de volta para a parte superior

Tarefa 3: Criar o modelo

Siga estas etapas para criar o modelo:

  1. Clique duas vezes no nó response_01 (Seleção de recurso) para ver suas propriedades.
  2. Expanda a seção Build Options (Opções de criação ) para ver as regras e os critérios definidos que são usados para triagem ou desqualificação de campos.
    Figura 4. Opções de construção de seleção de recursos
    Opções de construção para o nó Seleção de recursos
  3. Passe o mouse sobre o nó response_01 (Seleção de recurso) e clique no ícone ExecutarÍcone de execução.
  4. No painel Outputs and models (Saídas e modelos ), clique no modelo com o nome response_01 para visualizar o modelo. Os resultados mostram os campos que são considerados úteis na previsão, classificados por importância. Ao examinar esses campos, é possível decidir quais usar nas sessões de modelagem subsequentes.

    Para comparar os resultados sem a seleção de recursos, você deve usar dois nós de modelagem CHAID no fluxo: um que usa a seleção de recursos e outro que não usa.

  5. Clique duas vezes no nó With All Fields (CHAID) para ver suas propriedades.
    1. Em Objetivos, verifique se as opções Criar novo modelo e Criar um modelo padrão estão selecionadas.
    2. Expanda a seção Básica e verifique se a Profundidade máxima da árvore está definida como Personalizada e o número de níveis está definido como " 5.
  6. Clique em Salvar.
  7. Clique duas vezes no nó Using Top 10 Fields (CHAID) para ver suas propriedades
    1. Verifique as mesmas propriedades do nó With All Fields (CHAID).
    2. Clique em Salvar.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Modelagem. Agora você está pronto para executar o fluxo e visualizar os resultados.

nó CHAID

de volta para a parte superior

Tarefa 4: executar o fluxo e visualizar os resultados

Siga estas etapas para executar o fluxo e visualizar os resultados dos dois modelos com e sem seleção de recursos:

  1. Clique em Run all Ícone de execução. Durante a execução, observe o tempo que cada modelo leva para terminar de ser construído.
  2. No painel Outputs and models (Saídas e modelos ), clique no modelo com o nome With All fields (Com todos os campos ) para visualizar os resultados.
    1. Clique na página Diagrama de árvore.
    2. Diminua o zoom para ver o escopo do diagrama de árvore.
    3. Feche a janela de detalhes do modelo.
  3. No painel Outputs and models (Saídas e modelos ), clique no modelrun com o nome Using Top 10 fields (Usando os 10 principais campos ) para visualizar os resultados.
    1. Clique na página Diagrama de árvore.
    2. Diminua o zoom para ver o escopo do diagrama de árvore.

    Pode ser difícil dizer, mas o segundo modelo rodou mais rápido do que o primeiro. Como esse conjunto de dados é relativamente pequeno, a diferença nos tempos de execução provavelmente é de apenas alguns segundos; mas para conjuntos de dados maiores do mundo real, a diferença pode ser perceptível; minutos ou até horas. O uso da seleção de recursos pode acelerar drasticamente seu tempo de processamento.

    Em vez disso, você pode usar um algoritmo de construção de árvore para fazer o trabalho de seleção de recursos, permitindo que a árvore identifique os preditores mais importantes para você. Na verdade, o algoritmo CHAID é frequentemente usado para esse propósito e é até possível aumentar a árvore nível a nível para controlar sua profundidade e complexidade. No entanto, o nó Feature Selection é mais rápido e fácil de usar. Ele classifica todos os preditores em uma única etapa rápida, ajudando-o a identificar rapidamente os campos mais importantes.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o diagrama de árvore do modelo.

Modelo de visualização Diagrama de árvore

de volta para a parte superior

Resumo

A segunda árvore também contém menos nós da árvore do que a primeira. É mais fácil de compreender. Usar menos preditores é menos caro. Significa que você tem menos dados para coletar, processar e alimentar em seus modelos. O tempo de cálculo foi aprimorado. Neste exemplo, mesmo com a etapa de seleção de recurso extra, a construção do modelo foi mais rápida com o conjunto menor de preditores. Com um conjunto maior de dados do mundo real, a economia de tempo pode ser bastante ampliada.

Usar menos preditores resulta em uma pontuação mais simples. Por exemplo, você pode identificar apenas quatro perfis de clientes que provavelmente responderão à promoção. Com um número maior de preditores, você corre o risco de ajustar demais o modelo. O modelo mais simples pode se generalizar melhor para outros conjuntos de dados (embora seja necessário testar essa abordagem para ter certeza).

Próximas etapas

Agora você está pronto para experimentar outros tutoriais do SPSS® Modeler.