Reduzir o comprimento da cadeia de dados de entrada
Este tutorial fornece um exemplo de quando você pode precisar reduzir o comprimento da cadeia de dados de entrada. Para regressão logística binomial e modelos de classificador automático que incluem um modelo de regressão logística binomial, os campos de sequência de caracteres são limitados a um máximo de oito caracteres. Quando as cadeias de caracteres tiverem mais de oito caracteres, você poderá recodificá-las usando um nó Reclassify.
Este exemplo se concentra em uma pequena parte de um fluxo para mostrar o tipo de erro que pode ser gerado com cadeias de caracteres muito longas e explica como usar o nó Reclassify para alterar os detalhes da cadeia de caracteres para um comprimento aceitável. Embora o exemplo use um nó de regressão logística binomial, você também pode usar o nó Auto Classifier para gerar um modelo de regressão logística binomial.
Visualizando o tutorial
Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.
Experimente o tutorial
Neste tutorial, você concluirá estas tarefas:
Exemplo de fluxo do modelador e conjunto de dados
Este tutorial usa o fluxo Reducing Input Data String Length (Reduzindo o comprimento da cadeia de caracteres de dados de entrada ) no projeto de amostra. O arquivo de dados usado é drug_long_name.csv. A imagem a seguir mostra o fluxo do modelador de amostra.


Tarefa 1: Abrir o projeto de amostra
O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:
- Em Cloud Pak for Data no menu de navegação
, escolha Projetos > Exibir todos os projetos.
- Clique em SPSS Modeler Project.
- Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.
Verifique seu progresso
A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Tarefa 2: Examinar o nó Data Asset e Type
A redução do comprimento da cadeia de dados de entrada inclui vários nós. Siga estas etapas para examinar o nó Data Asset and Type:
- Na guia Assets (Ativos ), abra o fluxo do modelador Reducing Input Data String Length (Reduzindo o comprimento da cadeia de dados de entrada ) e aguarde o carregamento da tela.
- Clique duas vezes no nó drug_long_name.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo drug_long_name.csv no projeto.
- Revise as propriedades do formato do arquivo.
- Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.
- Clique duas vezes no nó Type após o nó Data Asset. Esse nó especifica as propriedades do campo, como o nível de medição (o tipo de dados que o campo contém) e a função de cada campo como alvo ou entrada na modelagem. O nível de medição é uma categoria que indica o tipo de dados no campo. O arquivo de dados de origem usa três níveis de medição diferentes:
- Um campo contínuo (como o campo "
Age) contém valores numéricos contínuos. - Um campo nominal (como o campo "
Drug) tem dois ou mais valores distintos; nesse caso, "drugAou "drugB. - Um campo de sinalizador (como o campo "
Sex) descreve dados com vários valores distintos que têm uma ordem inerente; nesse caso, "Fe "M.
Figura 3. Propriedades do nó de tipo 
Para cada campo, o nó Type também especifica uma função para indicar o papel que cada campo desempenha na modelagem. A função está definida como Target para o campo "
Cholesterol_long, que é o campo que indica se um cliente tem nível normal ou alto de colesterol. O alvo é o campo para o qual você deseja prever o valor.A função é definida como Input para os outros campos. Os campos de entrada às vezes são conhecidos como preditores ou campos cujos valores são usados pelo algoritmo de modelagem para prever o valor do campo de destino.
- Um campo contínuo (como o campo "
- Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto de dados filtrados.
Verifique seu progresso
A imagem a seguir mostra o nó Type. Agora você está pronto para visualizar o nó Logistic.

Tarefa 3: Reclassificar valores
Nesta tarefa, você executa o modelo e descobre um erro. Siga estas etapas para reclassificar os valores e evitar o erro:
- Na seção Modelagem da paleta, arraste o nó Logística para a tela e conecte-o ao nó Tipo existente após o nó Ativo de dados.
- Clique duas vezes no nó Cholesterol_long para ver suas propriedades.
- Selecione o procedimento Binomial (em vez do procedimento Multinomial padrão).
- Um modelo binomial é usado quando o campo de destino é um sinalizador ou campo nominal com dois valores discretos.
- Um modelo multinomial é usado quando o campo de destino é um campo nominal com mais de dois valores.
- Clique em Salvar.
- Passe o mouse sobre o nó Cholesterol_long e clique no ícone Run (Executar )
. Uma mensagem de erro avisa que os valores da sequência de caracteres
Cholesterol_longsão muito longos. Você pode usar um nó Reclassify para transformar os valores e corrigir esse problema. O nó Reclassify é útil para recolher categorias ou reagrupar dados para análise.Figura 4. Notificações 
- Clique duas vezes no nó Cholesterol (Reclassify) para ver suas propriedades. Observe que o campo Reclassify está definido como "
Cholesterol_longe o nome do novo campo é "Cholesterol. - Clique em Get values (Obter valores ) e expanda a seção Automatically Reclassify (Reclassificar automaticamente ). Adicione os valores de "
Cholesterol_longà coluna de valor original. - Na nova coluna de valores, para o valor original High level of cholesterol (Nível alto de colesterol ), digite "
Highe, para o valor original Normal level of cholesterol (Nível normal de colesterol ), digite "Normal. Essas configurações encurtam os valores para evitar a mensagem de erro.
Verifique seu progresso
A imagem a seguir mostra o nó Reclassify. Agora você está pronto para verificar o nó Filter.

Tarefa 4: Verificar o nó Filter
Siga estas etapas para ver e verificar o nó Filter:
- Clique duas vezes no nó Filter para ver suas propriedades.
- Observe que esse nó filtra o campo "
Cholesterol_long.
Verifique seu progresso
A imagem a seguir mostra o nó Filter. Agora você está pronto para definir o alvo.

Tarefa 5: Definir o alvo
Você pode especificar as propriedades do campo em um nó Type. Siga estas etapas para definir o destino no nó Tipo:
- Clique duas vezes no nó Type após o nó Filter para visualizar suas propriedades.
- Clique em Read values (Ler valores) para ler os valores de sua fonte de dados e definir os tipos de medição de campo. A função informa aos nós de modelagem se os campos são de entrada (campos de previsão) ou de destino (campos de previsão) para um processo de aprendizado de máquina. Ambas e Nenhuma também são funções disponíveis, juntamente com Partição, que indica um campo usado para particionar registros em amostras separadas para treinamento, teste e validação. O valor Split especifica que modelos separados são criados para cada valor possível do campo.
- No campo Cholesterol, defina a função como Target (Alvo).
- Clique em Salvar.
Verifique seu progresso
A imagem a seguir mostra o nó Type. Agora você está pronto para gerar o modelo.

Tarefa 6: Gerar o modelo
Siga estas etapas para visualizar a saída do modelo em formato de tabela:
- Passe o mouse sobre o nó Colesterol (Logística) e clique no ícone Executar
.
- Na seção Outputs (Saídas ) da paleta, arraste o nó Table (Tabela ) para a tela e conecte-o ao nugget do modelo.
- Passe o mouse sobre o nó Table que está conectado ao modelo Cholesterol e clique no ícone Run (Executar )
.
- No painel Outputs and models (Saídas e modelos ), clique nos resultados de saída com o nome Table (Tabela ) para visualizar a saída da tabela.
Verifique seu progresso
A imagem a seguir mostra o resultado do modelo.

Resumo
Esse exemplo mostrou o tipo de erro que pode ser gerado com cadeias de caracteres muito longas e explica como usar o nó Reclassify para alterar os detalhes da cadeia de caracteres para um comprimento aceitável. Embora o exemplo use um nó de regressão logística binomial, ele é igualmente aplicável ao usar o nó Auto Classifier para gerar um modelo de regressão logística binomial.
Próximas etapas
Agora você está pronto para experimentar outros tutoriais do SPSS® Modeler.