Criação de regras a partir de definições de qualidade

Você pode criar regras de qualidade de dados a partir de definições de qualidade de dados em seu projeto.

Você pode aplicar mais de uma definição de qualidade de dados em uma tabela ou ligar a mesma definição a várias colunas da mesma tabela em uma regra de qualidade de dados única.

Pelo menos uma definição de qualidade de dados deve existir no projeto.

Requisito
Para descrições de regras e explicações de expressões geradas por IA, as seguintes configurações do projeto devem ser ativadas:

Para criar uma regra de qualidade de dados a partir de definições de qualidade de dados:

  1. Abra um projeto, clique em Novo ativo > Medir e monitorar a qualidade dos dados .

    Alternativamente, você pode criar uma regra diretamente a partir de uma definição de qualidade de dados.

  2. Defina detalhes:

    • Especificar um nome para a regra de qualidade dos dados.

    • Opcional: forneça uma descrição. Se as descrições geradas por IA estiverem ativadas, uma explicação da expressão e uma descrição baseada nessa explicação serão geradas quando você salvar a regra. Essa descrição é atualizada automaticamente sempre que você altera uma das expressões da regra, a menos que você tenha editado a descrição.

    • Selecione as dimensões de qualidade de dados para as quais essa regra de qualidade de dados contribui. As dimensões de qualidade de dados descrevem as métricas de qualidade de dados para a lógica de regra neste ativo.. As dimensões selecionadas podem ser usadas como categoria de relatório, para filtrar ou para visualizar dados selecionados.

      É possível escolher entre estas opções:

      Aplicar todas as dimensões pré-configuradas
      A regra contribui para as pontuações de todas as dimensões definidas nas definições de qualidade de dados usadas na regra. Essa é a configuração padrão.
      Aplicar apenas esta dimensão
      A regra contribui somente para a pontuação da dimensão selecionada As configurações de dimensões nas definições de qualidade de dados que são usadas nessa regra são ignorados Se você selecionar essa opção, mas não definir uma dimensão de qualidade de dados, as pontuações de qualidade de dados das verificações individuais da regra serão capturadas na dimensão Nenhum.
    • Opcional: mude o tipo de regra que você deseja criar para uma regra baseada em SQL. Neste caso, prossiga com as instruções em Criando uma regra baseada em SQL.

  3. Inclua pelo menos uma definição de qualidade de dados Se você criar a regra de uma definição de qualidade de dados diretamente, essa definição já estará pré-selecionada. No entanto, é possível excluir essa definição de qualidade de dados pré-selecionada e selecionar diferentes..

    Para incluir as definições de qualidade de dados, clique em Incluir e selecione todas as definições de qualidade de dados que você deseja usar para criar várias verificações dentro da mesma regra O botão Incluir estará disponível apenas quando nenhuma definição de qualidade de dados for selecionada Depois de incluir pelo menos uma definição, é possível incluir definições adicionais usando o ícone de mais.

    Para qualquer definição de qualidade de dados no diálogo Selecionar definição de qualidade de dados , a expressão de regra configurada é exibida no painel lateral para ajudá-lo a escolher a definição mais adequada para o seu propósito.

    Se você desejar aplicar a mesma definição a colunas diferentes de uma tabela, será possível duplicar a definição de qualidade de dados selecionada quantas vezes forem necessárias

    Uma entrada separada na tabela de saída é criada para cada verificação aprovada ou reprovada, dependendo da configuração de saída.

  4. Configurar ligações.

    • Se sua regra não exigir processamento adicional dos dados, configure as ligações diretamente.

      Para cada definição de qualidade de dados, ligue os dados a todas as variáveis na expressão de regras É possível ligar dados da coluna, valores literais ou parâmetros de emprego a uma variável. Dependendo das ligações configuradas, você pode precisar criar joins conforme descrito na próxima etapa.

      Para concluir suas ligações, é possível mover entre as definições de qualidade dos dados usando as setas Anterior e Avançar ou a lista suspensa. A tabela de ligações mostra todas as variáveis juntamente com seu tipo de dados. Para cada variável, selecione um tipo de ligação e os dados para ligar a variável a.

      Ao ligar dados de coluna a uma variável na regra diretamente, é possível utilizar dados de todos os ativos de dados no projeto que vem de uma das conexões suportadas. Se desejar ligar dados de uma conexão criada com credenciais pessoais, será necessário desbloquear a conexão primeiro. Além dos ativos de dados de uma conexão, você pode trabalhar com ativos de dados de arquivos no formato CSV que você carregou do sistema de arquivos local ou de conexões baseadas em arquivos para as fontes de dados.

    • Se as associações em sua regra exigirem o pré-processamento de dados ou se você quiser incluir informações adicionais em sua tabela de saída, não será possível associar os dados diretamente na regra. Em vez disso, ative a opção Gerenciar vinculações externamente.

      Para continuar, ative DataStage. Todos os vínculos existentes são removidos e são criados um fluxo DataStage e um subfluxo DataStage. Por padrão, o fluxo DataStage é denominado <rule_name>_DataStage_flow, mas você pode alterar esse nome. No entanto, o nome do subfluxo DataStage é sempre DataStage subflow of data rule <rule_name>. Configure o fluxo DataStage depois de concluir a configuração da regra.

      Uma regra com vínculos externos é criada como um subfluxo reutilizável do DataStage que você pode adicionar uma ou várias vezes a qualquer número de fluxos do DataStage.

      Opcionalmente, você pode selecionar a criação de um fluxo DataStage que já contenha uma instância do subfluxo da regra. Esse fluxo é o fluxo padrão. O nome padrão desse fluxo DataStage gerado é <rule_name>_DataStage_flow, mas você pode alterar esse nome. No entanto, o nome do subfluxo DataStage é sempre <rule_name>_subflow. Configure o fluxo DataStage, seja um fluxo gerado ou um fluxo que você cria em DataStage, depois de concluir a configuração da regra. Consulte Gerenciamento de regras em um fluxo DataStage.

      Quando você cria regras tão complexas e gerencia as ligações externamente, pode trabalhar com todos os ativos de dados provenientes de conexões compatíveis com o site DataStage. Consulte DataStage connectors (conectores ).

    Para que uma regra de qualidade de dados com ligações externas contribua para a pontuação de qualidade de dados de uma coluna e do ativo que a contém, você tem estas opções:

    • Defina colunas na guia Estágio de um subfluxo de regra. Qualquer valida a qualidade dos dados das relações definidas no ativo de regra de qualidade de dados e que são ignoradas para o relatório de índice de qualidade.
    • Define Valida a qualidade dos dados de relacionamentos para as colunas no ativo de regra de qualidade de dados. O índice de qualidade é relatado nessas colunas somente se você não tiver configurado nenhuma coluna no subfluxo de regras.

    Você pode configurar relatórios de pontuação refinados no estágio de subfluxo da regra, selecionando colunas diferentes para cada definição de qualidade de dados usada na regra. Se você não fornecer uma configuração de relatório e tiver vinculado ativos e colunas com o tipo de relacionamento Valida a qualidade dos dados a uma regra, a mesma pontuação e os mesmos problemas serão relatados para esses ativos e colunas. Nenhuma pontuação é relatada se você não configurou nenhuma coluna para relatório de índice de qualidade.

    Além de ligar uma variável de regras a um único valor literal ou coluna, você pode trabalhar com parâmetros de tarefa no nível do projeto..

    É possível usar a opção Parâmetro para literal para ligar suas variáveis de regras a valores literais que são gerenciados centralmente e podem ser mudados no tempo de execução Tais parâmetros geralmente representam um fato ou uma peça específica de dados. Ao usar um parâmetro em vez do valor real em uma regra, você garante que a regra sempre use o valor mais atual deve a mudança de valor.

    Antes de se ligar variáveis de regra a parâmetros de trabalho, você deve criar um conjunto de parâmetros DataStage reutilizável:

    1. Em seu projeto, clique em New asset > Define reusable sets of parameters (Novo ativo > Definir conjuntos de parâmetros reutilizáveis ).
    2. Definir parâmetros com valores padrão ou com conjuntos de valor. Para uso em regras, é possível definir parâmetros do tipo data, integer, string, float, time ou timestamp. Não há suporte para outros tipos.

    Ao trabalhar com conjuntos de valor, é possível alterar o valor da variável para cada execução de tarefa. Edite os valores de parâmetro de tempo de execução e reexecute o job.

    Também é possível definir colunas para uso em ligações como parâmetros de tarefa no nível do projeto para uma manutenção mais fácil Os parâmetros de coluna consistem em um ID de ativo e um nome de coluna e também são armazenados em conjuntos de parâmetro DataStage . É possível criar um novo conjunto de parâmetros ou incluir parâmetros de coluna em um conjunto de parâmetros existente Nesse caso, você deve criar um parâmetro da sequência de tipos e inserir o ID do ativo e o nome da coluna necessários manualmente como o valor padrão. A maneira mais fácil é incluir esse parâmetro na etapa de ligação quando você criar uma regra

    1. Como Tipo de ligação, selecione Parâmetro da coluna. Em seguida, clique em Selecionar Parâmetro
    2. Todos os conjuntos de parâmetros disponíveis são listados Expanda aquele com o qual você deseja trabalhar
    3. Para incluir um parâmetro, clique no ícone de mais.
    4. Especifique o nome do parâmetro Ignore o campo Prompt .. Ele não é usado para parâmetros de coluna
    5. Selecione um ativo de dados e uma coluna Sua seleção é configurada como valor padrão do parâmetro.

    Os conjuntos de valores não podem ser usados com parâmetros de coluna. Além disso, não é possível alterar os parâmetros da coluna em tempo de execução.

    Se você atualizar um parâmetro de coluna que é usado em mais de uma regra, deverá executar novamente cada uma dessas regras de qualidade de dados abrindo-a e clicando em Executar regra.

    Em projetos nos quais o conteúdo gerado por IA está habilitado, as explicações para as expressões de regra utilizadas são geradas após todas as ligações estarem concluídas ou quando você seleciona gerenciar as ligações externamente. Se você alterar uma expressão em uma regra com ligações diretas, a explicação para essa expressão será atualizada automaticamente.

  5. Criar junções. Se suas ligações não exigirem junções, será possível mover para a próxima etapa. Mas, se você deseja usar dados de várias tabelas na tabela de saída, é necessário criar junções nessas tabelas. Se você gerenciar ligações externamente, você não pode criar joins na configuração de regra. As joias também devem ser definidas no fluxo DataStage .

    Se as suas ligações requerem junções, as tabelas estão listadas. Uma marca de verificação na coluna Join complete é mostrada depois de configurar uma junção. Na tabela Join keys , complete estas etapas para cada junção que você deseja definir:

    1. Clique em Adicionar par de chaves.

    2. Clique em Chave 1. Em seguida, selecione o primeiro item que você deseja utilizar na junção.

    3. Clique em Chave 2 e selecione o segundo item.

    4. Selecione o tipo de junção:

      Junção Interna
      Registros em que as colunas selecionadas contêm valores iguais são transferidos para o conjunto de dados de saída.
      Junção Externa à Esquerda
      Todos os registros da coluna selecionada para a chave 1 são transferidos para a tabela de saída. Os registros da coluna selecionada para a chave 2 são transferidos somente quando os valores coincidem.
      Junção Externa à Direita
      Todos os registros da coluna selecionada para a chave 2 são transferidos para a tabela de saída. Os registros da coluna selecionada para a chave 1 são transferidos somente quando os valores coincidem.
      Junção externa integral
      Todos os registros das tabelas são transferidos para a tabela de saída.

    Você pode alterar o tipo de junção a qualquer momento. No entanto, se você quiser alterar sua seleção para a chave 1 ou chave 2, você deve excluir o par de chaves existente e criar um novo.

  6. Opcional: Configurar amostragem.

    Se você não quiser ou precisar avaliar todas as linhas de um ativo de dados, ative a amostragem de dados. Assim, é possível gerar resultados com base em uma fração de seus dados.

    Para ativos de dados conectados regulares, a amostragem é feita na origem de dados.. Na maioria dos bancos de dados, a ordem dos registros não é determinística.. Portanto, os registros incluídos na amostra podem variar de uma execução para outra, o que significa que os resultados e o conteúdo da tabela de saída (se configurada) também podem mudar com o tempo.

    Para ativos de dados conectados baseados em consulta, a amostragem não é feita na origem de dados, mas no estágio Sample do fluxo DataStage que está associado à regra.

    1. Defina o tamanho máximo da amostra. Selecione o número máximo de registros que você deseja incluir em sua amostra de dados. O valor padrão é de 1.000 registros.

    2. Selecione um método de amostragem:

      Sequencial
      A amostra inclui os primeiros registros x do ativo de dados. Dependendo do tamanho do ativo de dados, o número x pode ser até o valor especificado como o tamanho de amostra máximo permitido. Por exemplo, se você tem 1.000.000 registros e você especifica um tamanho máximo de amostra de 2.000, a amostra inclui os primeiros 2.000 registros.
      Intervalo
      A amostra inclui cada nth registro até o tamanho máximo permitido da amostra ser atingido. Por exemplo, se você tiver 1.000.000 de registros e especificar um tamanho de amostra de 2.000 com um intervalo de 10, serão lidos no máximo 20.000 registros (2.000*10), em que cada 10º registro é selecionado para recuperar o tamanho da amostra de 2.000.
      Aleatório
      A amostra inclui registros selecionados aleatoriamente até o tamanho máximo permitido da amostra. A fórmula usada para selecionar registros é (100/sample_percent)*sample_size*2. O número 2 é usado na fórmula para assegurar que registros suficientes sejam lidos para produzir um tamanho de amostra aleatório válido. Por exemplo, se você tem 1.000.000 registros e você especifica um tamanho de amostra de 2.000 e um percentual de 5, a amostra inclui 2.000 registros. Para criar a amostra, no máximo 80.000 registros ((100/ 5) * 2.000 * 2 = 80.000) são lidos.
      No campo Porcentagem , especifique a porcentagem que deseja usar para criar a amostra. Especifique um valor maior que 0 e até 100.
  7. Configurar configurações de saída e conteúdo.

    Selecione se deseja que a saída da regra seja gravada em um banco de dados. Se não, apenas algumas informações estatísticas são fornecidas na história de execução da regra. Para obter mais informações, consulte Definição de configurações de saída para regras de qualidade de dados.

  8. Revise sua configuração. Você pode testar uma regra com associações diretas antes de salvá-la no projeto para ter certeza de que a regra está configurada corretamente.

    O resultado do teste da regra é exibido diretamente. Em geral, são exibidos no máximo 100 registros. Se você configurou alguma definição de saída, a saída corresponde à sua configuração. Se você não configurou nenhuma definição de saída, os registros que não atendem às condições da regra são listados. Inicialmente, apenas as colunas vinculadas são exibidas, mas você pode usar o botão para exibir todas as colunas. Você deve ter a permissão de usuário Drill down to issue details (Detalhes da emissão) para ver todas as colunas. Para regras com várias definições de qualidade de dados, os resultados para cada definição são exibidos em uma guia separada.

    Para alterar a configuração, clique no ícone Editar Editar ícone no bloco e atualize as configurações.

    Quando sua revisão estiver concluída, selecione uma das opções que se aplicam ao tipo de regra que você criou:

    • Para uma regra com ligações diretas, clique em Criar ou Criar regra e definir tarefa. Para ambas as opções de criação, a regra e seu fluxo de e-mail relacionado ( DataStage ) são adicionados ao projeto. O nome padrão do fluxo “ DataStage ” é DataStage flow of data rule <rulename>. Não edite esse fluxo Se você optar por criar apenas a regra, uma tarefa com configurações padrão será criada quando você executar a regra diretamente. Ou você pode criar uma tarefa com configurações personalizadas a qualquer momento posteriormente. Se você optar por definir também uma tarefa, poderá configurar diretamente as definições da tarefa. Para obter mais informações sobre as configurações, consulte Criação de tarefas para regras de qualidade de dados.

    • Para uma regra com ligações gerenciadas externamente, a regra e seu subfluxo e, dependendo da configuração, um fluxo padrão DataStage são adicionados ao projeto como ativos quando você clica em Criar.

    No entanto, essa regra ainda não está pronta para ser aplicada. Antes de poder executar a regra, você deve editar o fluxo DataStage. Para uma regra com um fluxo padrão DataStage, você também pode selecionar Create & edit DataStage flow. Nesse caso, a regra e o fluxo DataStage e seu subfluxo também são adicionados ao projeto, mas você é levado diretamente à configuração do fluxo DataStage. Para obter mais informações sobre a configuração do fluxo, consulte DataStage flows.

Se a sua regra estiver configurada adequadamente sem nenhuma informação ausente, ela tem o status Pronto. Esse status significa que a regra pode ser executada. O status de regra Não pronto indica que a regra não pode ser executada porque algumas dependências foram modificadas. Por exemplo, a definição de qualidade de dados foi atualizada ou uma tabela que é usada nas ligações da regra foi removida. O status Não pronto também será mostrado para regras com ligações gerenciadas externamente se o fluxo do DataStage associado não estiver configurado Após configurar o fluxo, é possível validar a regra selecionando Validar no menu overflow. Se a validação for bem-sucedida, o status será configurado como Prontoe será possível executar a regra..

Uma regra pode não ser mais válida após as modificações no ativo de dados que a regra analisa Portanto, talvez você queira validar o status da regra em qualquer caso antes de executar uma regra manualmente.

Gerenciando regras em um fluxo DataStage

Para adicionar uma regra de qualidade de dados a um fluxo DataStage :

  1. Abra o fluxo com o qual você deseja trabalhar.

  2. Em Conectores > Navegador de ativos, selecione a regra de qualidade de dados que você deseja adicionar. A regra é adicionada como um subfluxo.

  3. No fluxo principal, configure o pré-processamento e o pós-processamento conforme necessário e conecte os nós ao subfluxo de regras.

  4. Para editar as propriedades do nó, como as colunas de entrada ou saída, clique duas vezes no nó de regra. Não é possível alterar a configuração real da regra.

    Na guia Estágio, selecione as colunas para as quais você deseja relatar o índice de qualidade. Você pode configurar relatórios de pontuação refinados selecionando colunas diferentes para cada definição de qualidade de dados usada na regra. Se você não fornecer uma configuração de relatório no estágio de subfluxo da regra e tiver vinculado ativos e colunas com o tipo de relacionamento Valida a qualidade dos dados para uma regra, a mesma pontuação e os mesmos problemas serão relatados para esses ativos e colunas. Nenhuma pontuação é relatada se você não configurou nenhuma coluna para relatório de índice de qualidade.

    Para atualizar a lógica ou outros aspectos da regra de qualidade de dados, abra o ativo de regra no projeto. As alterações feitas no ativo da regra de qualidade de dados são refletidas em todos os fluxos DataStage nos quais a regra está incluída.

  5. Salve seu fluxo.

Saiba Mais

Próximas etapas