Avaliação da qualidade dos dados com regras
Para determinar se seus dados são de boa qualidade, verifique até onde os dados atendem às suas expectativas e identifique anomalias nos dados. Avaliar a qualidade dos dados também ajuda a entender a estrutura e o conteúdo dos seus dados.
Executar regras de qualidade de dados para avaliar dados com base nas condições definidas. O tipo de regra determina de onde os dados podem vir.
Regras que são criadas a partir de definições de qualidade de dados
É possível executar regras complexas com as ligações gerenciadas externamente em ativos de dados de qualquer conector que seja suportado pelo DataStage. Veja os conectores DataStage.
Para regras simples nas quais você liga os dados diretamente, as conexões lisadas em Conectores suportados são suportadas
Além disso, você pode trabalhar com ativos de dados de arquivos no formato CSV carregados do sistema de arquivos local ou de conexões baseadas em arquivos com as fontes de dados.
Regras baseadas em SQL
Para obter tipos de banco de dados suportados, consulte Conectores suportados.
Para que uma regra de qualidade de dados com ligações externas contribua para a pontuação de qualidade de dados de uma coluna, você pode definir a coluna na guia Estágio de um subfluxo de regra ou adicionar essa coluna como um item relacionado à regra correspondente usando o tipo de relacionamento Valida a qualidade dos dados. Se ambas as opções forem usadas, a configuração do subfluxo da regra terá precedência. Ao configurar as colunas para relatórios no estágio de subfluxo da regra, você pode selecionar colunas diferentes para cada definição de qualidade de dados usada na regra.
Para que uma regra de qualidade de dados baseada em SQL contribua para a pontuação de qualidade de dados de uma coluna, adicione essa coluna como um item relacionado à regra correspondente. Use o tipo de relacionamento Valida a qualidade dos dados de.
Os ativos que estão relacionados a qualquer tipo de regra de qualidade de dados com esse tipo de relacionamento também estão sujeitos a avaliações de SLA de qualidade de dados.
- Serviços necessários
IBM watsonx.data intelligence
DataStage ou DataStage as a Service Anywhere
Com DataStage,, você pode executar regras de qualidade de dados nas regiões compatíveis. Com o DataStage as a Service Anywhere, você pode executar regras de qualidade de dados fora do IBM Cloud usando mecanismos remotos. Para obter mais informações sobre a configuração de mecanismos remotos, consulte a documentação do site DataStage as a Service Anywhere.- Permissões necessárias
Para executar as regras de qualidade de dados, deve-se ter a função Admin ou Editor no projeto Além disso, é necessário ter a permissão de usuário Execute data quality rules (Executar regras de qualidade de dados ). Além disso, é necessário ter autorização para acessar as conexões com as fontes de dados dos ativos de dados a serem verificados.
Para visualizar os dados que causaram problemas de qualidade de dados (a tabela de saída) a partir do histórico de execução da regra ou da página Qualidade dos dados, você deve ter a permissão de usuário Detalhar os detalhes do problema. No entanto, o conjunto de dados do projeto criado para a tabela de saída só pode ser acessado por quem tiver acesso à conexão. Para limitar o acesso a esse ativo de dados, a conexão com a fonte de dados em que a tabela de saída está armazenada deve ser configurada com credenciais pessoais.
Você também pode concluir as tarefas a seguir com APIs em vez da interface do usuário. Os links para essas APIs estão listados na seção Saiba mais .
Executando regras de qualidade de dados
A execução de uma regra de qualidade de dados requer um fluxo DataStage e, posteriormente, um trabalho DataStage.
Ao criar a regra, você pode optar por criar apenas a regra ou a regra e uma tarefa associada a ela. Se você criar apenas a regra, um trabalho com as configurações padrão será criado quando você executar a regra pela primeira vez. Ou você pode criar uma tarefa com configurações personalizadas a qualquer momento posteriormente. Se você optar por definir também uma tarefa ao criar a regra, poderá configurar diretamente as definições da tarefa. Para obter mais informações sobre as configurações, consulte Criação de tarefas para regras de qualidade de dados.
Você também pode criar manualmente tarefas adicionais do DataStage para sua regra, seja a partir do menu de overflow da regra no projeto ou, ao abrir o ativo, a partir do menu de overflow ao lado do nome do ativo ou clicando no sinal de mais ao lado da entrada Tarefas no painel lateral de visão geral do ativo. Consulte Criação de tarefas para executar regras de qualidade de dados.
Para confirmar que uma regra ainda é válida antes de ser executada manualmente, é possível verificar o status da regra selecionando Validar no menu overflow.
É possível executar uma regra de uma destas maneiras:
- Abra a regra de qualidade de dados e clique em Executar regra.. Use esta opção para a execução inicial da regra para criar o trabalho associado do DataStage . Use também essa opção de execução para selecionar os fluxos DataStage que você deseja executar para essa regra.
- Selecione Executar no menu de estouro de regra do projeto. O fluxo padrão DataStage é executado. Essa opção não está disponível para regras incluídas em fluxos criados manualmente no site DataStage.
- Vá para a página Jobs do projeto, abra os detalhes do trabalho e execute-o clicando no ícone Run (Executar )
na barra de ações.
Também é possível automatizar as verificações de qualidade configurando tarefas com um planejamento de repetição para executar uma regra
As regras são executadas com credenciais do IBM Cloud . Geralmente, sua chave API pessoal do IBM Cloud é usada para executar essas operações de longa execução sem interrupção. Se as credenciais não estiverem disponíveis ao criar a tarefa, será solicitado que você crie uma chave de API. Essa chave de API é então salva como suas credenciais de tarefa.
Regras de agrupamento em um único fluxo do DataStage
É possível agrupar determinadas regras de qualidade de dados em um único fluxo de DataStage para execução:
As regras de qualidade de dados devem ser criadas a partir de definições de qualidade de dados.
As variáveis da regra devem ser vinculadas a um único ativo de dados no projeto:
- Um único arquivo de um destes conectores de armazenamento de arquivos: Amazon S3, Apache HDFS, Azure Data Lake Storage ou Google Cloud Storage
- Um arquivo que foi carregado do sistema de arquivos local
- Um único ativo de dados relacional
- Um único ativo de dados baseado em SQL
Dependendo da configuração das regras individuais de qualidade de dados que você agrupa, a execução das regras pode exigir várias passagens sobre os dados.
Não é possível agrupar regras de qualidade de dados que estejam vinculadas a vários ativos de dados.
Você pode usar a seguinte chamada de API para agrupar regras para execução:
POST /data_quality/v3/projects/{project_id}/execute_rules
Essa chamada de API requer os seguintes parâmetros:
- project_id
A ID do projeto que contém as regras
- Corpo da solicitação
A carga útil no seguinte formato:
{ "rules": [ { "id": "<rule1_id>" }, { "id": "<rule2_id>" } ] }
Pushdown de processamento em regras de qualidade de dados
Para a maioria das fontes de dados, certos aspectos do processamento das regras de qualidade dos dados podem ser transferidos para a própria fonte de dados, a fim de reduzir a quantidade de dados transferidos para fora da fonte e acelerar o processamento. A seleção de colunas, a criação de junções entre diferentes ativos de dados e a amostragem são enviadas para fontes de dados com um Sistema de gerenciamento de banco de dados relacional (RDBMS), o que significa que eles suportam consultas SQL. No caso de fontes de dados baseadas em arquivos, nenhum processamento é transferido para baixo. As regras de qualidade de dados baseadas em SQL são sempre executadas na fonte de dados.
No caso de regras de qualidade de dados aplicadas a dados provenientes de uma conexão com o Databricks e configuradas sem uma tabela de saída, toda a expressão da regra pode ser convertida e processada na fonte de dados, sem que haja transferência de dados. É possível ativar ou desativar esse tipo de processamento pushdown para projetos específicos. Para obter mais informações, consulte “Configurações do projeto para regras de qualidade de dados: Pushdown ”.
Com o DataStage as a Service Anywhere, você pode executar regras de qualidade de dados fora do IBM Cloud usando mecanismos remotos. Para obter mais informações sobre a configuração de mecanismos remotos, consulte a documentaçãoDataStage as a Service Anywhere.
Seleção de coluna
Para fontes de dados RDBMS, uma instrução SQL SELECT comoselect colA, colB from schema1.table1 é executado na fonte de dados para recuperar apenas as colunas necessárias de uma tabela. Essas consultas não podem ser executadas em ativos de dados provenientes de conexões de armazenamento de arquivos. Para esses arquivos, todas as colunas são recuperadas e o DataStage O estágio Modify é usado para filtrar as colunas.
Junções
Se uma regra de qualidade de dados tiver duas ou mais variáveis vinculadas a vários ativos de dados, esses ativos de dados deverão ser unidos em determinadas colunas.
Para fontes de dados RDBMS, uma instrução SQL SELECT com uma cláusula JOIN comoSELECT col1, col2 FROM schema1.table1 INNER JOIN schema1.table2 ON table1.id = table2.id é executado na fonte de dados. Com esta consulta, a junção dos ativos de dados é feita na fonte de dados. Algumas fontes de dados RDBMS não suportam processamento JOIN ou suportam apenas certos tipos de cláusulas JOIN. Por exemplo, Google BigQuery não suporta cláusulas JOIN.
Os resultados das regras de qualidade de dados com uniões também dependem de como valores como nulos e cadeias de caracteres vazias são tratados pela fonte de dados do RDBMS durante o processamento da união.
Para um ativo de dados de uma conexão de armazenamento de arquivos, todos os registros de cada ativo de dados individual são recuperados e o DataStage O estágio de junção é usado para unir os ativos de dados.
Amostragem
Para fontes de dados RDBMS, a amostragem aleatória e sequencial é feita na fonte de dados. Para amostragem sequencial, uma cláusula específica do RDBMS para selecionar os registros é incluída na instrução SQL, por exemplo, FETCH FIRST ou LIMIT.
Para um ativo de dados de uma conexão de armazenamento de arquivos, todos os registros são recuperados e o DataStage O estágio de amostra é usado para criar a amostra.
Verificando o histórico de execução
Sempre que você executa uma regra de qualidade de dados, é criado um registro de execução. Esses registros de execução estão listados no histórico de execução da regra, para que você possa ver como os resultados mudaram a cada execução. Para visualizar os registros de execução, abra a regra de qualidade de dados e acesse a guia Histórico de execução. Cada registro de execução fornece estas informações:
- A hora de início da corrida como um hiperlink. Clique no vínculo para acessar os varejistas de execução da tarefa
- O nome do trabalho correspondente do DataStage como um hiperlink. Clique no link para acessar os detalhes da tarefa
- O status da execução.
- Para regras que foram criadas a partir de definições de qualidade de dados:
- O número de registros que foram testados
- O número de registros e a porcentagem de registros testados que atenderam à regra
- O número de registros e a porcentagem de registros testados que não atenderam à regra
- Um link para a tabela de resultados do projeto e um link para baixar a tabela de resultados (se disponível).
- Para regras baseadas em SQL:
- O número de registros retornados pela instrução select na coluna Registros retornados.
- Um link para a tabela de resultados do projeto e um link para baixar a tabela de resultados (se disponível).
Todos os registros de execução são salvos e armazenados até que você os exclua. Considere limpar o histórico de execução regularmente para economizar espaço. É possível excluir registros de execução selecionados ou todos os registros de uma vez. Quando você exclui um registro de execução, os detalhes da execução da tarefa correspondente também são excluídos
Verificando a tabela de saída de regra.
Se uma tabela de saída for definida para a regra, a saída de regras será gravada em uma tabela de banco de dados, conforme configurado Consulte a etapa para definir as configurações de saída em Criando regras a partir de definições de qualidade de dados ou Criando regras baseadas em SQL
A tabela de saída também é incluída no projeto como ativo de dados. É possível acessar a tabela de saída de uma destas maneiras:
- Acesse o histórico de execução da regra e clique em Visualizar tabela de saída.. Você pode baixar a saída da regra como um arquivo CSV, por exemplo, para uso em um programa de planilha eletrônica, se desejar pesquisar ou filtrar a saída que contém um grande número de registros. A página de saída também fornece um vínculo para o ativo de dados correspondente no projeto
- Abra a tabela de saída no projeto Procure um ativo de dados com o mesmo nome da tabela de saída definida na regra.
- Acesse a tabela no banco de dados usando as consultas de banco de dados nativas
Saiba Mais
- Funções e permissões
- API IBM Knowledge Catalog : Executar regra de qualidade de dados
- API IBM Knowledge Catalog : Histórico de listagem de todos os resultados de execução de regras de qualidade de dados ou um subconjunto deles
- API IBM Knowledge Catalog : Obter a execução da regra de qualidade de dados