Configuração de definições de saída para regras de qualidade de dados
Para capturar mais saída de regras do que informações estatísticas, configure um local de saída externo e o conteúdo que você deseja que seja gravado nesse local.
Você pode optar por gravar a saída da regra em uma tabela de banco de dados. Se as ligações em uma regra baseada em definição forem gerenciadas externamente, você também terá a opção de criar até 4 ligações de saída DataStage.
Para gerar uma tabela de banco de dados ou links de saída:
Ative a opção Saída externa e expanda a seção.
Se você definir uma configuração de tabela de saída nas configurações do projeto, poderá optar por herdar essa configuração e ir diretamente para a configuração do conteúdo de saída. Uma configuração herdada é mostrada como Atual.
Se não quiser usar a tabela que está configurada nas definições do projeto, selecione o tipo de saída que deseja gerar:
Grave a saída em uma tabela de banco de dados nova ou existente.
Selecione uma conexão. Dependendo da conexão selecionada, selecione um esquema ou selecione um catálogo e um esquema. Para uma nova tabela, digite o nome da tabela de saída a ser criada. Caso contrário, selecione uma tabela existente. Nesse caso, a seção Conteúdo de saída é preenchida com as colunas dessa tabela e você pode mapear o conteúdo para essas colunas.
Você pode escolher se a tabela de saída deve ser adicionada ao seu projeto como um ativo de dados ao executar a regra.
Para obter informações sobre os tipos de bancos de dados compatíveis, consulte Conectores compatíveis para curadoria e qualidade de dados.
Quando você define uma nova tabela, o nome da tabela pode ser um nome definido pelo usuário, um parâmetro para criar um nome dinamicamente, uma combinação de nome definido pelo usuário e parâmetro ou uma combinação de parâmetros.
Os nomes de tabelas definidos pelo usuário devem seguir essa convenção:
- O primeiro caractere do nome deve ser um caractere alfabético.
- O restante do nome pode consistir em caracteres alfabéticos, caracteres numéricos ou sublinhados.
- O nome não deve conter espaços.
Para a criação de nomes dinâmicos, você pode usar esses parâmetros:
#execution_id##rule_id##rule_name##project_id##job_id##rule_id##job_run_id##rule_id#
Para os parâmetros com valores variáveis, uma nova tabela pode ser criada:
- Para
#job_run_id#para cada regra, execute - Para
#execution_id#, se a regra for executada na interface do usuário de regras de qualidade de dados ou por meio de uma chamada de API
Ao configurar o nome da tabela, lembre-se de que os bancos de dados de destino podem ter limites de comprimento para os nomes das tabelas. Parâmetros individuais ou uma combinação de parâmetros podem gerar nomes de tabelas que podem exceder o comprimento permitido. Por exemplo, um nome de regra pode ter até 256 caracteres, mas o banco de dados de destino pode não suportar nomes desse tamanho.
Além disso, você deve se certificar de que os nomes das tabelas de saída sejam exclusivos na fonte de dados. Especialmente os nomes criados dinamicamente não podem ser verificados antecipadamente quanto a colisões de nomes.
Além disso, você pode selecionar estas opções:
- Criar tabela somente quando forem encontrados problemas Essa opção evita que sejam criadas tabelas vazias nos casos em que uma regra não produz registros de saída. No entanto, se uma tabela com esse nome já existir porque foi gerada para uma execução de regra anterior, a tabela permanecerá inalterada.
- Importar a tabela de saída gerada como ativo do projeto Para facilitar o acesso à saída da regra, adicione novas tabelas de saída da regra como ativos de dados ao projeto. Em vez de executar uma consulta ao banco de dados, você pode visualizar os dados abrindo o ativo de dados na página "Ativos " do seu projeto ou no histórico de execuções. Esta opção está ativada por padrão.
Além disso, defina as seguintes configurações:
Registros de saída : Selecione se deseja incluir todos os registros na saída, apenas os registros que não atendem às condições da regra (configuração padrão) ou apenas os registros que atendem às condições da regra.
Número máximo de registros de saída de exceção : É possível incluir todos os registros ou definir um número máximo.
Método de atualização : Novos registros de saída podem ser anexados ao conteúdo existente da tabela de saída. Se quiser manter apenas os resultados de saída da última execução, selecione para substituir os registros existentes. Para o método de atualização Append, o esquema da tabela não pode ser alterado, ou seja, não é possível renomear, adicionar ou excluir colunas. Se você deseja alterar o conteúdo de saída de uma regra de qualidade de dados e gravar em uma tabela de saída existente, certifique-se de usar o método de atualização “Sobrescrever” para substituir as colunas da tabela de saída pelas colunas de saída recém-definidas.
Para a análise de dados em fluxo contínuo, por exemplo, provenientes de uma fonte de dados do tipo “ Kafka ”, leve em consideração as seguintes informações ao selecionar o método de atualização. Quando você executa uma regra de qualidade de dados em dados de streaming, é realizada uma análise incremental, o que significa que apenas os registros adicionados ao ativo após a última execução são analisados. As informações na guia “Qualidade dos dados” sempre mostram a contagem consolidada de problemas proveniente de todas as execuções de regras. No entanto, o conteúdo da tabela de resultados da qualidade dos dados varia de acordo com o método de atualização selecionado. Para o método de atualização Append, a tabela de saída também mostra os resultados consolidados das regras. No método de atualização “Overwrite”, são exibidos apenas os resultados da última execução, o que pode resultar em uma tabela vazia caso nenhum registro tenha sido adicionado nesse intervalo.
Crie links de saída se os vínculos forem gerenciados em um fluxo DataStage.
Configure até 4 links de saída. Selecione qual saída deve ser roteada para um link específico: todos os registros, apenas os registros que não atendem às condições da regra, apenas os registros que atendem às condições da regra ou todas as condições da regra violadas. Além disso, defina o número máximo de registros de saída a serem gravados por link. O conteúdo dos registros de saída é determinado pelo que você configurar na próxima etapa. Para condições de regra violadas, 0 ou mais registros de saída podem ser retornados, dependendo do número de definições de qualidade de dados na regra. Cada registro de saída tem as seguintes informações:
- A ID do registro. Essa métrica é definida automaticamente como uma coluna de saída.
- A ID da definição de uma das definições em que o registro de entrada não foi aprovado
- O número que identifica exclusivamente a definição com falha no caso de definições duplicadas
Para mapear o ID da definição para uma definição de qualidade de dados em seu projeto, use a API IBM Knowledge Catalog :
- Listar todas as definições de qualidade de dados ou um subconjunto delas
- Obter definição de qualidade de dados
Os nós de destino desses links de saída devem ser configurados no fluxo DataStage.
Você pode alterar o tipo de saída a qualquer momento. Dependendo de sua nova seleção, todas as configurações definidas serão redefinidas ou substituídas. Quando terminar, feche a seção e prossiga para configurar o conteúdo de saída.
Configure o conteúdo de sua tabela de saída.
- Se os vínculos forem gerenciados externamente, você poderá incluir quaisquer colunas adicionais fornecidas pelo link de entrada DataStage na tabela de saída. Tais colunas não estão listadas na configuração da tabela de saída. Você não pode incluir nenhuma variável usada em associações de regras.
- Clique em Adicionar conteúdo de saída e selecione uma destas opções:
Columns
Selecione as colunas que deseja ver em sua tabela de saída. Para regras baseadas em SQL, você pode selecionar todas as colunas que a consulta SQL retorna. A opção Colunas não estará disponível se você criar uma regra baseada em definição com ligações gerenciadas externamente.
Estatísticas e atributos
Selecione os atributos ou estatísticas adicionais que deseja incluir em sua tabela de saída. As métricas disponíveis dependem do tipo de regra de qualidade de dados.
Vinculado ao ID do ativo
Lista o ID do ativo de dados ao qual a regra está vinculada. Se essa métrica for selecionada, um registro de saída será gravado para cada ativo de dados em uma regra de qualidade de dados. Assim, mais de um registro de saída pode ser gravado para um registro de entrada individual. O conteúdo dos registros de saída para diferentes ativos da mesma regra de qualidade de dados varia apenas para essas métricas para cada registro de entrada individual: Definição da qualidade dos dados, ID da definição da qualidade dos dados, ID do ativo vinculado e talvez Regras de aprovação, Regras de reprovação, Porcentagem de regras de aprovação e Porcentagem de regras de reprovação
Você pode usar essa métrica somente em combinação com a métrica Definição de qualidade de dados ou ID de definição de qualidade de dados. Se a regra estiver associada a mais de uma definição de qualidade de dados, o Disambiguator métrico será automaticamente incluído na saída.
Essa métrica não está disponível para regras baseadas em definição com ligações gerenciadas externamente ou regras baseadas em SQL.
Ligada à coluna
Lista o nome de cada coluna vinculada. Se essa métrica for selecionada, um registro de saída será gravado para cada coluna em uma definição de qualidade de dados. Assim, mais de um registro de saída pode ser gravado para um registro de entrada individual. O conteúdo dos registros de saída para diferentes colunas da mesma definição de qualidade de dados varia apenas para essas métricas para cada registro de entrada individual: Definição de qualidade de dados, ID da definição de qualidade de dados, Vinculado à coluna e talvez Regras de aprovação, Regras de falha, Porcentagem de regras de aprovação e Porcentagem de regras de falha
Você pode usar essa métrica somente em combinação com a métrica Definição de qualidade de dados ou ID de definição de qualidade de dados. Se a regra estiver associada a mais de uma definição de qualidade de dados, o Disambiguator métrico será automaticamente incluído na saída.
Essa métrica não está disponível para regras baseadas em definição com ligações gerenciadas externamente ou regras baseadas em SQL.
Definição de qualidade de dados
Lista o nome da definição de qualidade de dados aplicada. Se essa métrica for selecionada, vários registros de saída poderão ser gravados, dependendo do número de definições de qualidade de dados que a regra contém.
Essa métrica não está disponível para regras baseadas em SQL.
ID de definição da qualidade de dados
Contém uma chave exclusiva que identifica a definição de qualidade de dados aplicada. Se essa métrica for selecionada, vários registros de saída poderão ser gravados, dependendo do número de definições de qualidade de dados que a regra contém.
Essa métrica não está disponível para regras baseadas em SQL.
Desambiguador
Contém um número para desambiguar as definições de qualidade de dados que são usadas na regra, principalmente se uma definição de qualidade de dados for usada várias vezes. A numeração começa em 0.
Essa métrica não está disponível para regras baseadas em SQL.
Regras de falha
Mostra o número de condições de regra que o registro não atendeu.
ID da tarefa
Contém uma chave exclusiva que identifica o trabalho que está associado ao fluxo DataStage da regra.
ID de execução da tarefa
Contém uma chave exclusiva que identifica uma execução individual do trabalho que está associada ao fluxo DataStage da regra.
Regras de aprovação
Mostra o número de condições de regra que o registro atendeu.
Porcentual de regras de aprovação
Mostra a porcentagem das condições da regra que foram atendidas.
Percentual de regras de falha
Mostra a porcentagem de condições de regras que não foram atendidas.
ID do projeto
Contém uma chave exclusiva que identifica o projeto no qual a regra reside.
ID de registro
Contém uma chave exclusiva que identifica um registro na saída. Essa métrica é incluída automaticamente nos links de saída para condições de regras violadas.
ID de regra
Contém uma chave exclusiva que identifica a regra de qualidade de dados.
Nome da regra
Contém o nome da regra de qualidade de dados.
Data do Sistema
Mostra a data do sistema em que a regra foi executada. A data do sistema é a data no fuso horário definido no servidor.
Horário do sistema
Mostra a data e a hora do sistema em que a regra foi executada. A data e a hora do sistema são a data e a hora no fuso horário definido no servidor.
Variáveis
Selecione as variáveis da lógica da regra que você deseja incluir na tabela de saída.
Expressões
Adicione uma expressão que defina o conteúdo de uma coluna de saída. Você pode dar a essa coluna um nome descritivo na visão geral do conteúdo de saída. Você pode usar elementos de bloco para construir sua expressão. Selecione e combine elementos conforme necessário. Para obter mais informações sobre o uso de elementos de bloco, consulte Gerenciamento de definições de qualidade de dados. Como alternativa, você pode usar o editor de formulário livre para construir a expressão. Consulte Blocos de construção para lógica de regras ou saída de regras.