Reduzir o comprimento da cadeia de dados de entrada

Este tutorial fornece um exemplo de quando você pode precisar reduzir o comprimento da cadeia de dados de entrada. Para regressão logística binomial e modelos de classificador automático que incluem um modelo de regressão logística binomial, os campos de sequência de caracteres são limitados a um máximo de oito caracteres. Quando as cadeias de caracteres tiverem mais de oito caracteres, você poderá recodificá-las usando um nó Reclassify.

Este exemplo se concentra em uma pequena parte de um fluxo para mostrar o tipo de erro que pode ser gerado com cadeias de caracteres muito longas e explica como usar o nó Reclassify para alterar os detalhes da cadeia de caracteres para um comprimento aceitável. Embora o exemplo use um nó de regressão logística binomial, você também pode usar o nó Auto Classifier para gerar um modelo de regressão logística binomial.

Visualizando o tutorial

Assistir vídeo Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.

Experimente o tutorial

Neste tutorial, você concluirá estas tarefas:

Exemplo de fluxo do modelador e conjunto de dados

Este tutorial usa o fluxo Reducing Input Data String Length (Reduzindo o comprimento da cadeia de caracteres de dados de entrada ) no projeto de amostra. O arquivo de dados usado é drug_long_name.csv. A imagem a seguir mostra o fluxo do modelador de amostra.

Figura 1. Fluxo do modelador de amostras
Fluxo de exemplo mostrando reclassificação de sequência de caracteres para regressão logística binomial
A imagem a seguir mostra o conjunto de dados de amostra.
Figura 2 Conjunto de dados de amostra
Conjunto de dados de amostra

Tarefa 1: Abrir o projeto de amostra

O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:

  1. Em Cloud Pak for Data no menu de navegação Menu de Navegação, escolha Projetos > Exibir todos os projetos.
  2. Clique em SPSS Modeler Project.
  3. Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Projeto de amostra

de volta para a parte superior

Tarefa 2: Examinar o nó Data Asset e Type

A redução do comprimento da cadeia de dados de entrada inclui vários nós. Siga estas etapas para examinar o nó Data Asset and Type:

  1. Na guia Assets (Ativos ), abra o fluxo do modelador Reducing Input Data String Length (Reduzindo o comprimento da cadeia de dados de entrada ) e aguarde o carregamento da tela.
  2. Clique duas vezes no nó drug_long_name.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo drug_long_name.csv no projeto.
  3. Revise as propriedades do formato do arquivo.
  4. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.
  5. Clique duas vezes no nó Type após o nó Data Asset. Esse nó especifica as propriedades do campo, como o nível de medição (o tipo de dados que o campo contém) e a função de cada campo como alvo ou entrada na modelagem. O nível de medição é uma categoria que indica o tipo de dados no campo. O arquivo de dados de origem usa três níveis de medição diferentes:
    • Um campo contínuo (como o campo " Age ) contém valores numéricos contínuos.
    • Um campo nominal (como o campo " Drug ) tem dois ou mais valores distintos; nesse caso, " drugA ou " drugB.
    • Um campo de sinalizador (como o campo " Sex ) descreve dados com vários valores distintos que têm uma ordem inerente; nesse caso, " F e " M.
    Figura 3. Propriedades do nó de tipo
    nó Tipo

    Para cada campo, o nó Type também especifica uma função para indicar o papel que cada campo desempenha na modelagem. A função está definida como Target para o campo " Cholesterol_long, que é o campo que indica se um cliente tem nível normal ou alto de colesterol. O alvo é o campo para o qual você deseja prever o valor.

    A função é definida como Input para os outros campos. Os campos de entrada às vezes são conhecidos como preditores ou campos cujos valores são usados pelo algoritmo de modelagem para prever o valor do campo de destino.

  6. Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados filtrados.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Type. Agora você está pronto para visualizar o nó Logistic.

nó Tipo

de volta para a parte superior

Tarefa 3: Reclassificar valores

Nesta tarefa, você executa o modelo e descobre um erro. Siga estas etapas para reclassificar os valores e evitar o erro:

  1. Na seção Modelagem da paleta, arraste o nó Logística para a tela e conecte-o ao nó Tipo existente após o nó Ativo de dados.
  2. Clique duas vezes no nó Cholesterol_long para ver suas propriedades.
  3. Selecione o procedimento Binomial (em vez do procedimento Multinomial padrão).
    • Um modelo binomial é usado quando o campo de destino é um sinalizador ou campo nominal com dois valores discretos.
    • Um modelo multinomial é usado quando o campo de destino é um campo nominal com mais de dois valores.
  4. Clique em Salvar.
  5. Passe o mouse sobre o nó Cholesterol_long e clique no ícone Run (Executar ) Ícone de execução. Uma mensagem de erro avisa que os valores da sequência de caracteres Cholesterol_long são muito longos. Você pode usar um nó Reclassify para transformar os valores e corrigir esse problema. O nó Reclassify é útil para recolher categorias ou reagrupar dados para análise.
    Figura 4. Notificações
    Mensagem de erro
  6. Clique duas vezes no nó Cholesterol (Reclassify) para ver suas propriedades. Observe que o campo Reclassify está definido como " Cholesterol_long e o nome do novo campo é " Cholesterol.
  7. Clique em Get values (Obter valores ) e expanda a seção Automatically Reclassify (Reclassificar automaticamente ). Adicione os valores de " Cholesterol_long à coluna de valor original.
  8. Na nova coluna de valores, para o valor original High level of cholesterol (Nível alto de colesterol ), digite " High e, para o valor original Normal level of cholesterol (Nível normal de colesterol ), digite " Normal. Essas configurações encurtam os valores para evitar a mensagem de erro.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Reclassify. Agora você está pronto para verificar o nó Filter.

Reclassificar as propriedades do nó

de volta para a parte superior

Tarefa 4: Verificar o nó Filter

Siga estas etapas para ver e verificar o nó Filter:

  1. Clique duas vezes no nó Filter para ver suas propriedades.
  2. Observe que esse nó filtra o campo " Cholesterol_long.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Filter. Agora você está pronto para definir o alvo.

Propriedades do nó de filtro

de volta para a parte superior

Tarefa 5: Definir o alvo

Você pode especificar as propriedades do campo em um nó Type. Siga estas etapas para definir o destino no nó Tipo:

  1. Clique duas vezes no nó Type após o nó Filter para visualizar suas propriedades.
  2. Clique em Read values (Ler valores) para ler os valores de sua fonte de dados e definir os tipos de medição de campo. A função informa aos nós de modelagem se os campos são de entrada (campos de previsão) ou de destino (campos de previsão) para um processo de aprendizado de máquina. Ambas e Nenhuma também são funções disponíveis, juntamente com Partição, que indica um campo usado para particionar registros em amostras separadas para treinamento, teste e validação. O valor Split especifica que modelos separados são criados para cada valor possível do campo.
  3. No campo Cholesterol, defina a função como Target (Alvo).
  4. Clique em Salvar.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o nó Type. Agora você está pronto para gerar o modelo.

Tipo de nó de destino

de volta para a parte superior

Tarefa 6: Gerar o modelo

Siga estas etapas para visualizar a saída do modelo em formato de tabela:

  1. Passe o mouse sobre o nó Colesterol (Logística) e clique no ícone ExecutarÍcone de execução.
  2. Na seção Outputs (Saídas ) da paleta, arraste o nó Table (Tabela ) para a tela e conecte-o ao nugget do modelo.
  3. Passe o mouse sobre o nó Table que está conectado ao modelo Cholesterol e clique no ícone Run (Executar ) Ícone de execução.
  4. No painel Outputs and models (Saídas e modelos ), clique nos resultados de saída com o nome Table (Tabela ) para visualizar a saída da tabela.

Ícone de ponto de controle Verifique seu progresso

A imagem a seguir mostra o resultado do modelo.

Saída do modelo

de volta para a parte superior

Resumo

Esse exemplo mostrou o tipo de erro que pode ser gerado com cadeias de caracteres muito longas e explica como usar o nó Reclassify para alterar os detalhes da cadeia de caracteres para um comprimento aceitável. Embora o exemplo use um nó de regressão logística binomial, ele é igualmente aplicável ao usar o nó Auto Classifier para gerar um modelo de regressão logística binomial.

Próximas etapas

Agora você está pronto para experimentar outros tutoriais do SPSS® Modeler.