Introdução à modelagem
Visualizando o tutorial
Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver pequenas diferenças na interface do usuário mostrada no vídeo. O vídeo deve ser um complemento do tutorial escrito. Este vídeo oferece um método visual para aprender os conceitos e as tarefas desta documentação.
Experimente o tutorial
Neste tutorial, você concluirá estas tarefas:
Exemplo de fluxo do modelador e conjunto de dados
Este tutorial usa o fluxo de Introdução à modelagem no projeto de amostra. O arquivo de dados usado é tree_credit.csv. A imagem a seguir mostra o fluxo do modelador de amostra.

A capacidade de prever um resultado é o objetivo central da análise preditiva, e entender o processo de modelagem é a chave para usar os fluxos SPSS Modeler.
O modelo neste exemplo mostra como um banco pode prever se futuros solicitantes de empréstimo podem inadimplir em seus empréstimos. Esses clientes anteriormente tomavam empréstimos do banco, de modo que os dados dos clientes eram armazenados no banco de dados do banco. O modelo usa os dados dos clientes para determinar a probabilidade de eles serem padronizados.
Uma parte importante de qualquer modelo é os dados que entram nele. O banco mantém um banco de dados de informações históricas sobre os clientes, incluindo se eles pagaram os empréstimos (Classificação de crédito = Bom) ou inadimplência (Classificação de crédito = Ruim). O banco deseja usar esses dados existentes para construir o modelo Os campos a seguir são utilizados:
| Nome do campo | Descrição |
|---|---|
| Credit_rating | Classificação de crédito: 0=Bad, 1=Good, 9=missing values |
| Idade | Idade em anos |
| Receita | Nível de renda: 1=Low, 2=Medium, 3=High |
| Credit_cards | Número de cartões de crédito que possui: 1=Less than five, 2=Five or more |
| Educação | Nível de educação: 1=High school, 2=College |
| Car_loans | Número de empréstimos para compra de carro contraídos: 1=None or one, 2=More than two |
Este exemplo usa um modelo de árvore de decisão , que classifica registros (e prevê uma resposta) usando uma série de regras de decisão..

Por exemplo, essa regra de decisão classifica um registro como tendo uma boa classificação de crédito quando a renda cai no intervalo médio e o número de cartões de crédito é menor do que 5.
IF income = Medium
AND cards <5
THEN -> 'Good'
Utilizando um modelo de árvore de decisão, é possível analisar as características dos dois grupos de clientes e prever a probabilidade de inadimplência no empréstimo.
Embora este exemplo use um modelo CHAID (Chi-squared Automatic Interaction Detection), ele deve ser uma introdução geral e a maioria dos conceitos se aplica amplamente a outros tipos de modelagem no SPSS Modeler.
Tarefa 1: Abrir o projeto de amostra
O projeto de amostra contém vários conjuntos de dados e fluxos de modelador de amostra. Se você ainda não tiver o projeto de amostra, consulte o tópico Tutoriais para criar o projeto de amostra. Em seguida, siga estas etapas para abrir o projeto de amostra:
- No Cloud Pak for Data, no menu de navegação "
, escolha Projetos > Exibir todos os projetos.
- Clique em SPSS Modeler Project.
- Clique na guia Assets (Ativos ) para ver os conjuntos de dados e os fluxos do modelador.
Verifique seu progresso
A imagem a seguir mostra a guia Assets (Ativos) do projeto. Agora você está pronto para trabalhar com o fluxo do modelador de amostra associado a este tutorial.

Tarefa 2: Examinar os nós Data Asset e Type
Introdução à modelagem O fluxo do modelador inclui vários nós. Siga estas etapas para examinar os nós Data Asset e Type.
- Na guia Assets (Ativos ), abra o fluxo do modelador Introduction to Modeling (Introdução à modelagem ) e aguarde o carregamento da tela.
- Clique duas vezes no nó tree_credit.csv. Esse nó é um nó de ativo de dados que aponta para o arquivo tree_credit.csv no projeto. Se você especificar medições no nó de origem, não precisará incluir um nó Type separado no fluxo.
- Revise as propriedades do formato do arquivo.
- Opcional: Clique em Preview data (Visualizar dados) para ver o conjunto completo de dados.
- Clique duas vezes no nó Type. Esse nó especifica as propriedades do campo, como o nível de medição (o tipo de dados que o campo contém) e a função de cada campo como alvo ou entrada na modelagem. O nível de medição é uma categoria que indica o tipo de dados no campo. O arquivo de dados de origem usa três níveis de medição diferentes:
- Um campo contínuo (como o campo "
Age) contém valores numéricos contínuos. - Um campo nominal (como o campo "
Education) tem dois ou mais valores distintos: nesse caso, "Collegeou "High school. - Um campo ordinal (como o campo "
Income level) descreve dados com vários valores distintos que têm uma ordem inerente: nesse caso, "Low, "Mediume "High.
Figura 3. nó Tipo 
Para cada campo, o nó Type também especifica uma função para indicar o papel que cada campo desempenha na modelagem. A função é definida como Target para o campo "
Credit rating, que é o campo que indica se um cliente está inadimplente com o empréstimo. O alvo é o campo para o qual você deseja prever o valor.Os outros campos têm a função definida como Input. Os campos de entrada às vezes são conhecidos como preditores ou campos cujos valores são usados pelo algoritmo de modelagem para prever o valor do campo de destino.
- Um campo contínuo (como o campo "
- Opcional: Clique em Preview data (Visualizar dados) para ver os dados com as propriedades Type (Tipo ) aplicadas.
Verifique seu progresso
A imagem a seguir mostra o nó Type. Agora você está pronto para configurar o nó de modelagem.

Tarefa 3: Configurar o nó de modelagem
Um nó de modelagem gera um nugget de modelo quando o fluxo é executado. Este exemplo usa um nó CHAID. CHAID, ou Chi-squared Automatic Interaction Detection, é um método de classificação que cria árvores de decisão usando um tipo específico de estatística conhecido como estatística qui-quadrado. O nó usa estatísticas de qui-quadrado para determinar os melhores locais para fazer as divisões na árvore de decisão. Siga estas etapas para configurar o nó de modelagem:
- Clique duas vezes no nó Credit rating (CHAID) para ver suas propriedades.
- Na seção Fields (Campos ), observe a opção Use settings defined in this node (Usar configurações definidas neste nó ). Essa opção informa ao nó para usar o destino e os campos especificados aqui em vez de usar as informações de campo no nó Type. Para este tutorial, deixe a opção Usar configurações definidas neste nó desativada.
- Expanda a seção Objetivos. Nesse caso, os valores padrão são adequados. Seu objetivo é criar um novo modelo, criar um modelo padrão e gerar um nó de modelo após a execução.
- Expanda a seção Regras de interrupção. Para manter a árvore bastante simples neste exemplo, limite o crescimento da árvore aumentando o número mínimo de casos para os nós pai e filho.
- Selecione Usar valor absoluto.
- Defina o mínimo de registros no ramo pai como '
400. - Defina o mínimo de registros no ramo filho como '
200.
- Clique em Salvar.
- Passe o mouse sobre o nó Classificação de crédito (CHAID) e clique no ícone Executar '
.
Verifique seu progresso
A imagem a seguir mostra o fluxo com os resultados do modelo. Agora você está pronto para explorar o modelo.

Tarefa 4: Explorar o modelo
A execução do fluxo do modelador adiciona um nugget de modelo à tela com um link para o nó Modeling a partir do qual ele foi criado. Siga estas etapas para visualizar os detalhes do modelo:
- No painel Outputs and models (Saídas e modelos ), clique no modelo com o nome Credit rating (Classificação de crédito ) para visualizar o modelo.
- Clique em Model Information para ver informações básicas sobre o modelo.
- Clique em Feature Importance (Importância do recurso) para ver a importância relativa de cada preditor na estimativa do modelo. Nesse gráfico, você pode ver que o nível de renda é facilmente o mais significativo nesse caso, com o Número de cartões de crédito como o segundo fator mais significativo.
Figura 4. Gráfico Importância do recurso 
- Clique em Top Decision Rules para ver detalhes na forma de um conjunto de regras; essencialmente, uma série de regras que podem ser usadas para atribuir registros individuais a nós filhos com base nos valores de diferentes campos de entrada. Uma previsão de Bom ou Ruim é retornada para cada nó terminal na árvore de decisão. Os nós terminais são os nós da árvore que não são divididos posteriormente. Em cada caso, a previsão é determinada pelo modo, ou resposta mais comum, para registros que se enquadram nesse nó.
Figura 5. Nugget do modelo CHAID, conjunto de regras 
- Clique em Diagrama de árvore para ver o mesmo modelo na forma de uma árvore, com um nó em cada ponto de decisão. Passe o mouse sobre os ramos e nós para explorar os detalhes.
Figura 6. Diagrama de árvore no nugget do modelo 
Observando o início da árvore, o primeiro nó (nó 0) fornece um resumo de todos os registros no conjunto de dados. Mais de 40% dos casos no conjunto de dados são classificados como um mau risco. 40% é uma proporção bastante alta, mas a árvore pode dar pistas sobre os fatores que podem ser responsáveis.
A primeira divisão é por nível de renda. Os registros em que o nível de renda está na categoria Baixo são atribuídos ao nó 2 e não é surpresa ver que essa categoria contém a maior porcentagem de inadimplentes. Claramente, emprestar a clientes nesta categoria apresenta um alto risco. No entanto, quase 18% dos clientes dessa categoria não ficaram inadimplentes, portanto, a previsão nem sempre está correta. Nenhum modelo pode prever todas as respostas, mas um bom modelo deve permitir que você preveja a resposta mais provável para cada registro com base nos dados disponíveis.
Da mesma forma, se você observar os clientes de alta renda (nó 1), verá que a maioria dos clientes (mais de 88%) representa um bom risco. No entanto, mais de 1 em cada 10 desses clientes continuou inadimplente. Os critérios de empréstimo podem ser mais refinados para minimizar o risco aqui?
Observe como o modelo dividiu esses clientes em duas subcategorias (nós 4 e 5), com base no número de cartões de crédito mantidos. Para clientes de alta renda, se o banco emprestar apenas para clientes com menos de cinco cartões de crédito, ele poderá aumentar sua taxa de sucesso de 88% para quase 97%, um resultado ainda mais satisfatório.
Figura 7. Clientes de alta renda com menos de cinco cartões de crédito 
Mas e os clientes da categoria de renda média (nó 3)? Eles são muito mais uniformemente divididos entre as classificações boas e ruins. Novamente, as subcategorias (nós 6 e 7 neste caso) podem ajudar. Desta vez, os empréstimos apenas para clientes de renda média com menos de cinco cartões de crédito aumentam o percentual de avaliações Bom de 58% para 86%, uma melhoria significativa.
Figura 8. Visualização em árvore de clientes de renda média 
Verifique seu progresso
A imagem a seguir mostra os detalhes do modelo. Agora você está pronto para avaliar o modelo.

Tarefa 5: Avaliar o modelo
Você pode navegar pelo modelo para entender como funciona a pontuação. No entanto, para avaliar a precisão do funcionamento do modelo, é necessário marcar alguns registros. Os registros de pontuação são o processo de comparação dos resultados reais com as respostas previstas pelo modelo. Para avaliar o modelo, é possível pontuar os mesmos registros que foram usados para estimar o modelo. É possível comparar as respostas observadas e previstas comparando os mesmos registros. Siga estas etapas para avaliar o modelo:
- Anexe o nó Table ao nugget do modelo.
- Passe o mouse sobre o nó Table e clique no ícone Run (Executar ) '
.
- No painel Outputs and models (Saídas e modelos ), clique nos resultados de saída com o nome Table (Tabela ) para visualizar os resultados.
A tabela exibe as pontuações previstas no campo "
$R-Credit rating, que o modelo criou. Você pode comparar esses valores com o campo "Credit ratingoriginal que contém as respostas reais.Por convenção, os nomes dos campos que foram gerados durante a pontuação são baseados no campo de destino, mas com um prefixo padrão.$Ge '$GEsão prefixos para as previsões geradas pelo Modelo Linear Generalizado$Ré o prefixo para as previsões geradas pelo modelo CHAID$RCé para valores de confiança$Xé normalmente gerado por meio de um conjunto$XR, "$XS, "$XFsão usados como prefixos nos casos em que o campo de destino é um campo Contínuo, Categórico, Conjunto ou Bandeira
Um valor de confiança é a própria estimativa do modelo, em uma escala de 0,0 a 1,0, de quão preciso é cada valor previsto.
Figura 9. Tabela mostrando escoragens geradas e valores de confiança 
Como esperado, o valor previsto corresponde às respostas reais de muitos registros, mas não de todos. O motivo para isso é que cada nó terminal CHAID possui uma combinação de respostas. A previsão corresponde à mais comum, mas está errada para todas as outras nesse nó. (Lembre-se da minoria de 18% de clientes de baixa renda que não são inadimplentes.)
Para evitar esse problema, você poderia continuar dividindo a árvore em ramos cada vez menores até que cada nó fosse 100% puro; todos bons ou ruins, sem respostas mistas. Mas esse modelo é complicado e é improvável que se generalize bem para outros conjuntos de dados.
Para descobrir exatamente quantas previsões estão corretas, você pode ler a tabela e contar o número de registros em que o valor do campo previsto "
$R-Credit ratingcorresponde ao valor de "Credit rating. No entanto, é mais fácil usar um nó de análise, que rastreia automaticamente os registros em que esses valores correspondem. - Conecte o nugget do modelo ao nó Analysis.
- Passe o mouse sobre o nó Analysis e clique no ícone Run (Executar ) '
.
- No painel Outputs and models (Saídas e modelos ), clique nos resultados de saída com o nome Analysis (Análise ) para visualizar os resultados.
A análise mostra que, para 1960 dos 2.464 registros (mais de 79%), o valor que o modelo previu correspondeu à resposta real.
Figura 10. Resultados da análise comparando respostas observadas e preditas 
Esse resultado é limitado pelo fato de que os registros que você marcou são os mesmos que você usou para estimar o modelo. Em uma situação real, você poderia usar um nó Partition para dividir os dados em amostras separadas para treinamento e avaliação. Ao usar uma partição de amostra para gerar o modelo e outra amostra para testá-lo, você pode obter uma indicação melhor de como ele é generalizado para outros conjuntos de dados.
É possível usar o nó Analysis (Análise) para testar o modelo em relação a registros para os quais você já conhece o resultado real. A próxima etapa ilustra como é possível usar o modelo para pontuar registros para os quais não se conhece o resultado. Por exemplo, esse conjunto de dados pode incluir pessoas que não são clientes atuais do banco, mas que são alvos em potencial para uma mala direta promocional.
Verifique seu progresso
A imagem a seguir mostra o fluxo com os resultados de saída. Agora você está pronto para pontuar o modelo com novos dados.

Tarefa 6: Avaliar o modelo com novos dados
Anteriormente, você pontuou os registros que foram usados para estimar o modelo para que pudesse avaliar a precisão do modelo. Este exemplo pontua um conjunto de registros diferente dos usados para criar o modelo. A avaliação da precisão é um dos objetivos da modelagem com um campo-alvo. Você estuda os registros para os quais conhece o resultado para identificar padrões, de modo que possa prever os resultados que ainda não conhece.
Você pode atualizar o Data Asset existente ou o nó Importar para apontar para um arquivo de dados diferente. Ou você pode adicionar um Data Asset ou um nó de importação que leia os dados que deseja pontuar. De qualquer forma, o novo conjunto de dados deve conter os mesmos campos de entrada usados pelo modelo (Age, " Income level, " Education e assim por diante), mas não o campo de destino " Credit rating.
Como alternativa, você pode adicionar o nugget de modelo a qualquer fluxo que inclua os campos de entrada esperados. Independentemente de ser lido de um arquivo ou de um banco de dados, o tipo de fonte não importa se os nomes e tipos de campo corresponderem aos usados pelo modelo.
Verifique seu progresso
A imagem a seguir mostra o fluxo concluído.

Resumo
O fluxo de exemplo de Introdução à modelagem demonstra as etapas básicas para criar, avaliar e pontuar um modelo.
- O nó Modeling estima o modelo estudando os registros para os quais o resultado é conhecido e cria um nugget de modelo. Esse processo às vezes é chamado de treinamento do modelo.
- O nugget do modelo pode ser adicionado a qualquer fluxo com os campos esperados para pontuar registros. Ao escorar os registros para os quais você já sabe o resultado (como clientes existentes), é possível avaliar o seu grau de desempenho.
- Quando estiver satisfeito com o desempenho aceitável do modelo, você poderá pontuar novos dados (como clientes em potencial) para prever como eles responderão.
- Os dados usados para treinar ou estimar o modelo podem ser chamados de dados analíticos ou históricos. Os dados de pontuação também podem ser chamados de dados operacionais.
Próximas etapas
Agora você está pronto para experimentar outros tutoriaisSPSS Modeler.