Refinar dados com o Data Refinery
Para refinar os dados, você os retira de um local, limpa e modela e, em seguida, escreve o resultado em um local diferente. É possível limpar e formar dados tabulares com uma ferramenta de editor de fluxo gráfico chamada Data Refinery.
Ao purificar dados, você corrige ou remove dados que estão incorretos, incompletos, inadequadamente formatados ou duplicados. Ao formar dados, você os customiza filtrando, classificando, combinando ou removendo colunas.
Você cria um Fluxo do Data Refinery como um conjunto de operações ordenadas nos dados. O Data Refinery inclui uma interface gráfica para traçar o perfil dos seus dados para validá-los e mais de 20 gráficos customizáveis que fornecem insights sobre seus dados.
- Plataformas em nuvem
- Serviço necessário
- watsonx.ai Estúdio ou IBM watsonx.data intelligence
- Formato de dados
- Avro, CSV, JSON, Microsoft Excel (formatos xls e xlsx). Primeira folha apenas, exceto para conexões e ativos de dados conectados.), Parquet, SAS com a extensão “ sas7bdat ” (somente leitura), TSV (somente leitura) ou recurso de dados de texto delimitado
- Tabelas em origens de dados relacionais
- Tamanho dos dados
- Any. O Data Refinery opera em um subconjunto de amostras de linhas no conjunto de dados. O tamanho da amostra é de 1 MB ou 10.000 linhas, o que vier primeiro. No entanto, ao executar uma tarefa para o fluxo do Data Refinery, todo o conjunto de dados é processado. Se o fluxo do Data Refinery falhar com um ativo de dados grande, consulte as soluções alternativas em Resolução de Problemas do Data Refinery
Para obter mais informações sobre como escolher a ferramenta certa para seus dados e caso de uso, consulte Escolhendo uma ferramenta.
- Pré-requisitos
- Limitações de arquivo de origem
- Limitações de arquivo de destino
- Regras de proteção de dados
- Visualizações do conjunto de dados
- Refinar seus dados
Pré-requisitos
Para poder refinar dados, é necessário criar um projeto que use o Cloud Object Storage.
Assista a este vídeo para ver como criar um projeto.
Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.
Se você tiver dados em fontes de dados na nuvem ou no local, precisará " adicionar conexões para essas fontes ou " adicionar ativos de dados de cada conexão. Se desejar ser capaz de salvar dados refinados em origens de dados em nuvem ou no local, crie conexões para esse propósito também. No Data Refinery, as conexões de origem podem ser usadas apenas para ler dados; as conexões de destino podem ser usadas apenas para gravar dados. Ao criar uma conexão de destino, assegure-se de usar credenciais que tenham permissão de Gravação, ou você não conseguirá salvar sua saída de fluxo do Data Refinery no destino.
Assista a este vídeo para ver como criar uma conexão e incluir dados conectados a um projeto.
Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.
Se as pastas estiverem habilitadas no seu projeto, você poderá organizar seus fluxos do Data Refinery, seus ativos de dados de origem e destino e suas tarefas em pastas.
Limitações de arquivo de origem
arquivos CSV
Certifique-se que os arquivos CSV estejam corretamente formatados e se adéquem às regras a seguir:
- Duas vírgulas consecutivas em uma linha indicam uma coluna vazia.
- Se uma linha terminar com uma vírgula, uma coluna adicional será criada.
Se o seu arquivo CVS contiver alguma carga maliciosa (fórmulas, por exemplo) em um campo de entrada, esses itens poderão ser executados.
Caracteres em espaço branco são considerados parte dos dados
Se seus dados incluírem colunas que contêm caracteres de espaço branco (vazio), o Data Refinery considerará esses caracteres de espaço branco parte dos dados, mesmo que você não possa vê-los na grade. Algumas ferramentas de banco de dados podem preencher sequências de caracteres com caracteres de espaço branco para que todos os dados em uma coluna tenham o mesmo comprimento; esta mudança afeta os resultados das operações de comparação de dados do Data Refinery.
Nomes de colunas
Certifique-se de que os nomes de coluna se adéquem às regras a seguir:
- Nomes de coluna duplicados não são permitidos. Os nomes da coluna devem ser exclusivos dentro do conjunto de dados. Os nomes da coluna não fazem distinção entre maiúsculas e minúsculas. Um conjunto de dados que inclui um nome de coluna "Vendas" e outro nome de coluna "vendas" não funcionará.
- Os nomes de colunas não são palavras reservadas na linguagem de programação R.
- Os nomes de colunas não são números. Uma solução alternativa é colocar os nomes da coluna entre aspas duplas ("").
Conjuntos de dados com colunas com o tipo de dados "Outro" não são suportados nos fluxos do Data Refinery
Se o seu conjunto de dados contiver colunas com tipos de dados identificados como "Outros" na visualização do watsonx.ai Studio, as colunas serão exibidas como o tipo de dados String no Data Refinery. No entanto, se você tentar usar os dados em um fluxo do Data Refinery, a tarefa para o fluxo do Data Refinery falhará. Um exemplo de um tipo de dados que mostra como "Outro" na visualização é o tipo de dados DECFLOAT do DB2.
Limitações de arquivo de destino
A limitação a seguir se aplica se você salvar a saída de fluxo Data Refinery (o conjunto de dados de destino) para um arquivo:
- Não será possível mudar o formato de arquivo se o arquivo for um ativo de dados existente.
Regras de proteção de dados
Data Refinery não suporta regras de proteção de dados para filtragem de linhas. Data Refinery empregos podem falhar se o ativo for regido por regras de proteção de dados de filtragem de linhas. Além disso, se você adicionar um ativo de IBM watsonx.data intelligence a um projeto que seja regido por regras de proteção de dados de filtragem de linhas, o mascaramento não será aplicado em Data Refinery. Para obter informações, consulte Aplicação de regras de proteção de dados.
Visualizações do conjunto de dados
O Data Refinery fornece suporte para conjuntos de dados grandes, que podem ser demorados e difíceis de refinar. Para permitir que você trabalhe de forma rápida e eficiente, ele opera em um subconjunto de linhas no conjunto de dados enquanto você refina interativamente os dados. Ao executar uma tarefa para o fluxo do Data Refinery, ele opera no conjunto de dados inteiro.
Refinar seus dados
O vídeo a seguir mostra como refinar dados.
Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.
Transcrição de vídeo Horário Transcrição 00:00 Este vídeo mostra como utilizar o Data Refinery para fazer a formatação de dados brutos. 00:05 Para iniciar o refinamento de dados de um projeto, visualize o ativo de dados e abra-o no Data Refinery. 00:14 O painel de informações contém o nome do fluxo de dados e da saída do fluxo de dados, depois que você terminar de refinar os dados. 00:24 A guia “Dados” mostra um conjunto de amostras das linhas e colunas do conjunto de dados. 00:29 Para melhorar o desempenho, você não verá todas as linhas no shaper. 00:33 Mas tenha certeza de que, quando terminar de refinar os dados, o fluxo de dados será executado no conjunto de dados completo. 00:41 A guia "Perfil" mostra estatísticas de frequência e de resumo para cada uma de suas colunas. 00:48 A guia "Visualizações" fornece visualizações de dados para as colunas nas quais você está interessado 00:57 Os gráficos sugeridos têm um ponto azul próximos de seus ícones. 01:03 Use as diferentes perspectivas disponíveis nos gráficos para identificar padrões, conexões e relacionamentos dentro dos dados. 01:12 Agora, faremos contestações de dados. 01:15 Comece com uma operação simples, como classificar em uma coluna específica; neste caso, a coluna “Ano”. 01:24 Digamos que você queira se concentrar nos atrasos apenas de uma companhia aérea específica, então você pode filtrar os dados para mostrar apenas as linhas em que a única transportadora é a United Airlines. 01:42 Seria útil poder ver o atraso total. 01:45 Para fazer isso, é possível criar uma nova coluna, combinando os atrasos de chegada e de partida. 01:50 Observe que o tipo de coluna é inferido como um número inteiro. 01:54 Selecione a coluna de atrasos de partida e utilize a operação “Calcular”. 02:03 Nesse caso, você adicionará a coluna de atraso na chegada à coluna selecionada e criará uma nova coluna chamada "TotalDelay". 02:13 Você pode posicionar a nova coluna no final da lista de colunas ou próximo à coluna original. 02:21 Quando você aplica a operação, a nova coluna é exibida ao lado da coluna de atraso de partida 02:28 Se você cometer um erro ou simplesmente decidir fazer uma alteração, basta acessar o painel “Etapas” e excluir essa etapa. 02:36 Isso desfaz essa ação específica. 02:40 Também é possível usar os botões refazer e desfazer. 02:44 Em seguida, você deseja focar na "TotalDelay" coluna, então pode usar a operação “selecionar” para mover a coluna para o início. 03:02 Este comando organiza a coluna de atraso total como a primeira da lista, e tudo o resto vem depois dela. 03:12 Por fim, você deseja encontrar a média da coluna "TotalDelay". 03:16 Ao expandir o menu de operações na seção “Organizar”, você encontrará a operação “Agregar”, que inclui a função “Média”. 03:33 Agora, você tem uma nova coluna chamada "AverageDelay" que representa a média do atraso total. 03:40 Agora, para executar o fluxo de dados, salve e crie a tarefa. 03:47 Insira o nome da tarefa e continue para a próxima tela. 03:52 A etapa “Configurar” permite que você revise quais serão as entradas e saídas da execução do seu trabalho e selecione o ambiente usado para executá-lo. 04:03 Agendar uma tarefa é opcional, mas você pode definir uma data e repetir a tarefa, se desejar. 04:13 E você pode optar por receber notificações para este trabalho. 04:19 Aparentemente, tudo está correto, portanto, crie e execute a tarefa. 04:22 Isso pode levar vários minutos, pois, lembre-se, o fluxo de dados será executado em todo o conjunto de dados. 04:28 Enquanto isso, é possível visualizar o status. 04:34 Quando a execução estiver concluída, você poderá voltar à guia “Ativos” no projeto e abrir o Data Refinery fluxo para refinar ainda mais os dados. 04:50 Por exemplo, você poderia classificar a coluna "AverageDelay" em ordem decrescente. 04:59 Agora, edite as configurações de fluxo 05:02 No painel "Geral", é possível mudar o nome do fluxo do Data Refinery 05:08 No painel “Conjuntos de dados de origem”, você pode editar a amostra ou o formato do conjunto de dados de origem ou substituir a fonte de dados. 05:18 E no painel "Conjunto de dados de destino", é possível especificar um local alternativo, como uma origem de dados externa. 05:28 Você também pode editar as propriedades do destino, como o modo de gravação, o formato do arquivo e alterar o nome do recurso do conjunto de dados. 05:43 Agora, execute o fluxo de dados novamente, mas desta vez salve e visualize os trabalhos. 05:51 Selecione na lista a tarefa que deseja visualizar e execute-a. 06:03 Quando a execução for concluída, volte ao projeto. 06:08 E na guia “Ativos”, você verá os três arquivos: o original; o primeiro conjunto de dados refinado, mostrando os "AverageDelay" dados não classificados; e o segundo conjunto de dados, mostrando a "AverageDelay" coluna classificada em ordem decrescente. 06:34 E novamente na guia "Ativos", há o fluxo do Data Refinery . 06:42 Encontre mais vídeos na documentação.
1. Acesse o Data Refinery de dentro de um projeto. Clique em Novo ativo> Preparar e visualizar dados.. Em seguida, selecione os dados com os qual você deseja trabalhar. Como alternativa, na guia Assets (Ativos ) de um projeto, clique em um ativo de dados para visualizá-lo e, em seguida, clique em Prepare data (Preparar dados).
2. Use etapas para aplicar operações que limpem, moldam e enricar seus dados. Navegue para Categorias de operação ou procurar uma operação específica e, em seguida, siga as instruções da IU. É possível inserir código R na linha de comandos e deixar que a conclusão automática o auxilie para obter a sintaxe correta. À medida que você aplica operações a um conjunto de dados, o Data Refinery mantém controle delas e constrói um fluxo do Data Refinery. Para cada operação que você aplica, o Data Refinery inclui uma etapa.
Guia Dados

Quando seus dados contêm tipos de dados diferentes de sequência de caracteres, a operação da GUI Converter tipo de coluna é aplicada automaticamente como a primeira etapa no fluxo do Data Refinery ao abrir um arquivo no Data Refinery. Os tipos de dados são convertidos automaticamente em tipos de dados inferidos, como Número inteiro, Data ou Booleano. É possível desfazer ou editar essa etapa.
3. Clique na guia Profile (Perfil ) para validar seus dados durante todo o processo de refinamento de dados.
Guia
Perfil 
4. Clique na aba Visualizações para visualizar os dados em gráficos. Descubra padrões, tendências e correlações dentro de seus dados.
Guia "Visualizações"

5. Refine o conjunto de dados de amostra para adequá-los às suas necessidades.
6. Clique em Salvar e criar uma tarefa ou Salvar e visualizar empregos na barra de ferramentas para executar o fluxo Data Refinery no conjunto de dados inteiro. Selecione o tempo de execução e inclua um planejamento único ou de repetição. Para obter informações sobre empregos, consulte Criando empregos em Data Refinery.
Para executar trabalhos, você precisa de uma chave de API de usuário. Normalmente, ele é criado automaticamente quando você cria seu primeiro trabalho. Você também pode criar manualmente uma chave de API em seu perfil e configurações.
Ao executar uma tarefa para o fluxo do Data Refinery, o conjunto de dados inteiro é processado. Assim, o trabalho pode criar um grande conjunto de dados de saída (destino) com base nas transformações e na quantidade de dados processados no fluxo. Por padrão, o resultado do fluxo do Data Refinery é salvo como um ativo de dados no projeto.
Para as ações que você pode fazer à medida que você refina seus dados, veja Gerenciando Data Refinery fluxos.