Automatizar a preparação de dados

Este tutorial fornece um exemplo de preparação de dados para análise. A preparação de dados é uma das etapas mais importantes em qualquer projeto de mineração de dados e, tradicionalmente, uma das mais demoradas. O nó Auto Data Prep cuida da tarefa para você, analisando seus dados e identificando correções, filtrando campos problemáticos ou que provavelmente não serão úteis, derivando novos atributos quando apropriado e melhorando o desempenho por meio de técnicas de triagem inteligentes.

Você pode usar o nó Auto Data Prep de forma totalmente automatizada, permitindo que o nó escolha e aplique correções, ou pode visualizar as alterações antes que elas sejam feitas e aceitá-las ou rejeitá-las. Com este nó, é possível preparar seus dados para mineração de dados de forma rápida e fácil, sem a necessidade de conhecimento prévio dos conceitos estatísticos envolvidos. Se você executar o nó com as configurações padrão, os modelos tendem a ser construídos e pontuados mais rapidamente.

Visualizando o tutorial

Assistir vídeo Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.

Experimente o tutorial

Neste tutorial, você concluirá estas tarefas:

Exemplo de fluxo do modelador e conjunto de dados

Este tutorial usa o fluxo de preparação automatizada de dados no projeto de amostra. O arquivo de dados usado é telco.csv. Esse exemplo demonstra a maior precisão que você pode encontrar ao usar as configurações padrão do nó Auto Data Prep ao criar modelos. A imagem a seguir mostra o fluxo do modelador de amostra.

Figura 1. Fluxo do modelador de amostras
Fluxo de exemplo de preparação automática de dados
A imagem a seguir mostra o conjunto de dados de amostra.
Figura 2 Conjunto de dados de amostra
Conjunto de dados de amostra

Tarefa 1: Abrir o projeto de amostra

O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:

  1. Em Cloud Pak for Data no menu de navegação Menu de Navegação, escolha Projetos > Exibir todos os projetos.
  2. Clique em SPSS Modeler Project.
  3. Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Projeto de amostra

de volta para a parte superior

Tarefa 2: Examinar os nós Data Asset e Type

A preparação automatizada de dados inclui vários nós. Siga estas etapas para examinar os nós Data Asset e Type:

  1. Na guia Assets (Ativos ), abra o fluxo do modelador Automated Data Preparation (Preparação automatizada de dados ) e aguarde o carregamento da tela.
  2. Clique duas vezes no nó telco.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo telco.csv no projeto.
  3. Revise as propriedades do formato do arquivo.
  4. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.
  5. Clique duas vezes no nó Type. Observe que a medida do campo " churn está definida como Flag (sinalizador) e a função está definida como Target (alvo). Certifique-se de que a função de todos os outros campos esteja definida como Input.
    Figura 3. Definir o nível e a função de medição
    Definir o nível e a função de medição
  6. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados com as propriedades Type (Tipo) aplicadas.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Type. Agora você está pronto para construir o modelo.

nó Tipo

de volta para a parte superior

Tarefa 3: Criar os modelos

Você criará dois modelos, um sem e outro com preparação automatizada de dados. Siga estas etapas para criar os modelos:

  1. Clique duas vezes no nó No ADP - churn que está conectado ao nó Type para ver suas propriedades.
    1. Expanda a seção Configurações do modelo
    2. Verifique se o Procedimento está definido como Binomial.
    3. Verifique se o Nome do modelo está definido como Personalizado e se o nome é " No ADP - churn.
      Figura 4. Seção Configurações do modelo de nó logístico
      Escolha as opções de modelo
  2. Passe o mouse sobre o nó No ADP - churn e clique no ícone Executar Ícone de execução.
  3. No painel Outputs and models, clique no modelo com o nome No ADP - churn para visualizar os resultados.
    1. Visualize a página de resumo do modelo, que mostra os campos de previsão usados pelo modelo e a porcentagem de previsões corretas.
    2. Visualize o Resumo do processamento de casos, que mostra o número e a porcentagem de registros incluídos na análise. Além disso, ele lista o número de casos ausentes (se houver) em que um ou mais campos de entrada não estão disponíveis e todos os casos que não foram selecionados.
    3. Feche os detalhes do modelo.
  4. Clique duas vezes no nó Auto Data Prep que está conectado ao nó Type para ver suas propriedades. O Automated Data Preparation cuida da tarefa de preparação de dados para você, analisando seus dados e identificando correções, filtrando campos problemáticos ou com pouca probabilidade de serem úteis, derivando novos atributos quando apropriado e melhorando o desempenho por meio de técnicas de triagem inteligentes.
    1. Na seção Objectives (Objetivos ), deixe as configurações padrão em vigor para analisar e preparar seus dados equilibrando velocidade e precisão. Outras propriedades do nó Auto Data Prep oferecem a opção de especificar que você deseja se concentrar mais na precisão, mais na velocidade de processamento ou ajustar muitas das etapas de processamento para a preparação de dados.
      Observação: se quiser ajustar as propriedades do nó e executar o fluxo novamente no futuro, uma vez que o modelo já existe, você deve primeiro clicar em Limpar análise antiga, em Objetivos, antes de executar o fluxo novamente.
    2. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados com as propriedades do Auto Data Prep aplicadas.
    3. Clique em Cancel.
  5. Clique duas vezes no nó After ADP - churn que está conectado ao nó Auto Data Prep para ver suas propriedades.
    1. Expanda a seção Configurações do modelo
    2. Verifique se o Procedimento está definido como Binomial.
    3. Verifique se o Nome do modelo está definido como Personalizado e se o nome é " After ADP - churn.
  6. Passe o mouse sobre o nó After ADP - churn e clique no ícone Run (Executar ) Ícone de execução.
  7. No painel Outputs and models, clique no modelo com o nome After ADP - churn para visualizar os resultados.
    1. Visualize a página de resumo do modelo, que mostra os campos de previsão usados pelo modelo e a porcentagem de previsões corretas.
    2. Visualize o Resumo do processamento de casos, que mostra o número e a porcentagem de registros incluídos na análise. Além disso, ele lista o número de casos ausentes (se houver) em que um ou mais campos de entrada não estão disponíveis e todos os casos que não foram selecionados.
    3. Feche os detalhes do modelo.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra os detalhes do modelo. Agora você está pronto para comparar os modelos.

Detalhes do modelo

de volta para a parte superior

Tarefa 4: Comparar os modelos

Agora que os dois modelos estão configurados, siga estas etapas para gerar e comparar os modelos:

  1. Passe o mouse sobre o nó No ADP - LogReg (Analysis) e clique no ícone Run (Executar ) Ícone de execução.
  2. Passe o mouse sobre o nó After ADP - LogReg (Analysis) e clique no ícone Run (Executar ) Ícone de execução.
  3. No painel Outputs and models (Saídas e modelos ), clique nos resultados de saída com o nome No ADP - LogReg para visualizar os resultados.
  4. Compare os modelos:
    1. Clique em Comparar.
    2. No campo Selecionar saída, selecione Depois do ADP - LogReg.
    A análise do modelo Auto Data Prep não derivado mostra que a simples execução dos dados por meio do nó Logistic Regression com suas configurações padrão fornece um modelo com baixa precisão - apenas 10.6.
    Figura 5. Resultados do modelo não derivado da preparação automática de dados
    Resultados do modelo não derivado da preparação automática de dados
    A análise do modelo derivado do Auto-Data Prep mostra que, ao executar os dados por meio das configurações padrão do Auto Data Prep, você criou um modelo muito mais preciso, que está 78.3 correto.
    Figura 6. Resultados do modelo derivado da preparação automática de dados
    Resultados do modelo derivado da preparação automática de dados

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra a comparação de modelos.

Comparar modelos

de volta para a parte superior

Resumo

Ao executar o nó Auto Data Prep para ajustar o processamento de seus dados, você conseguiu criar um modelo mais preciso com pouca manipulação direta de dados.

Obviamente, se você estiver interessado em provar ou refutar uma determinada teoria, ou se quiser criar modelos específicos, talvez seja vantajoso trabalhar diretamente com as configurações do modelo. No entanto, se você tiver tempo limitado ou uma grande quantidade de dados para preparar, o nó Auto Data Prep pode lhe dar uma vantagem.

Os resultados deste exemplo são baseados apenas nos dados de treinamento. Para avaliar a generalização dos modelos para outros dados no mundo real, é possível usar um nó Partition para manter um subconjunto de registros para fins de teste e validação.

Próximas etapas

Agora você está pronto para experimentar outros tutoriais do SPSS® Modeler.