Compreensão e preparação de dados
Antes de começar a minerar dados e criar modelos no SPSS Modeler, você precisa preparar seus dados. Preparar seus dados significa dedicar tempo para entender os dados e processá-los para que sejam otimizados para uso na mineração de dados.
A qualidade de seus dados pode determinar a qualidade de seus modelos. A preparação de seus dados garante que eles estejam limpos e prontos para análise.
SPSS Modeler foi desenvolvido com base na metodologia CRISP-DM (Cross-Industry Standard Process for Data Mining). que tem as seguintes fases.
- Entendimento dos negócios
- Entendimento de dados
- Preparação de dados
- Modelagem
- Avaliação
- Implementação
As três primeiras fases são aquelas em que os dados são coletados, avaliados e preparados. Parte desse trabalho pode ser feito no SPSS Modeler, mas parte do trabalho nessas fases acontece antes mesmo de trabalhar no SPSS Modeler.
Entendimento dos negócios
Antes de começar a usar o SPSS Modeler, é importante obter o máximo de informações possível sobre os objetivos comerciais da mineração de dados. Por exemplo, entenda a perspectiva comercial para determinar os pontos problemáticos, os requisitos do projeto, os objetivos comerciais da mineração de dados e como a mineração de dados pode fornecer informações úteis que resolvam os problemas comerciais.
Essa fase de coleta e preparação de dados ocorre fora do SPSS Modeler. Mas esse trabalho pode determinar quais dados precisam ser coletados e em quais dados vale a pena se concentrar.
Entendimento de dados
Compreender seus dados envolve avaliar os dados e explorá-los para determinar a qualidade dos dados. Dedique tempo para entender a estrutura, os relacionamentos e os padrões dos dados usando técnicas como visualização de dados, estatísticas resumidas e análise de correlação. Essa etapa é fundamental para evitar problemas inesperados durante a preparação dos dados.
SPSS Modeler tem um nó Audit, que pode ser usado para uma primeira análise abrangente dos dados. Ele pode gerar informações como estatísticas resumidas, histogramas, gráficos de caixa, gráficos de barras, gráficos de pizza e muito mais. Essas informações podem ser úteis para obter uma compreensão preliminar dos dados. Ele também é capaz de gerar informações sobre outliers, extremos e valores ausentes.
Se você tiver acesso a esses outros serviços no Cloud Pak for Data, eles também poderão ser úteis;
- Data Refinery
- Você pode usar o site Data Refinery para entender e visualizar seus dados.
- MANTA Automated Data Lineage
- Você pode usar MANTA Automated Data Lineage para rastrear e encontrar a origem dos dados.
- RStudio
- RStudio é útil para executar comandos no R para explorar seus dados.
Preparação de dados
A preparação de dados é uma das partes mais importantes da mineração de dados e pode representar uma quantidade significativa do trabalho necessário para o projeto geral. Esforçar-se nas fases anteriores de entendimento do negócio e de entendimento dos dados pode minimizar parte desse trabalho, mas você ainda precisa se esforçar para preparar e empacotar os dados para a mineração.
Realize as seguintes atividades para preparar seus dados. Essas atividades são necessárias para garantir que os dados estejam bem preparados, limpos e prontos para análise.
- limpeza de dados
- É essencial lidar com valores ausentes, remover duplicatas e corrigir problemas de formatação.
- Transformação de Dados
- Padronize e normalize seus dados para garantir a consistência e reduzir o ruído. Essas etapas podem envolver escalonamento, normalização de escore z ou codificação de um único disparo.
- Redução de dados
- Reduza a dimensionalidade de seus dados selecionando os recursos mais relevantes. Você pode usar técnicas como a Análise de Componentes Principais (PCA), a Análise Discriminante Linear (LDA) ou a Incorporação de Vizinhos Estocásticos Distribuídos t (t-SNE).
- Integração de dados
- Mesclar dados de diferentes fontes para criar uma visão mais abrangente de seus dados. Talvez você precise unir tabelas, mesclar conjuntos de dados ou usar técnicas de fusão de dados.
- Validação de Dados
- Valide seus dados para garantir que sejam precisos e confiáveis. Você pode verificar se há valores discrepantes, avaliar a variabilidade ou comparar os dados com fontes externas.
- Armazenamento de dados
- Armazene seus dados de forma segura, acessível e reproduzível. Você pode usar bancos de dados, data warehouses ou soluções de armazenamento em nuvem para armazenar seus dados.
SPSS Modeler tem vários nós que você pode usar para essas atividades de preparação de dados. É possível usar uma combinação de nós de operações de registro e nós de operações de campo para criar fluxos que preparem os dados.
Se você tiver acesso aos serviços a seguir, eles também poderão ser usados para preparar dados.
- Data Refinery
- Você pode usar o site Data Refinery para limpar e transformar dados sem precisar de habilidades de programação.
- DataStage
- Você pode usar o site DataStage para integração de dados e desenvolvimento de fluxos que processam e transformam dados.
- IBM® Knowledge Catalog
- Você pode usar o site IBM Knowledge Catalog para analisar e melhorar a qualidade dos dados e também pode ser usado para atribuir classificações, classes de dados e termos comerciais aos seus ativos de dados
- RStudio
- Você pode usar o site RStudio para executar comandos no R para explorar seus dados.
Mesmo que os dados não sejam seus, os usuários devem realizar as mesmas atividades para entender esses dados.