Projetando enriquecimentos de metadados
Ao enriquecer metadados de ativos, você deve decidir quais ativos de dados enriquecer, que tipo de metadados adicionar e se deve programar trabalhos de enriquecimento.
Geralmente, o enriquecimento de metadados faz parte de um plano de curadoria de dados maior Por exemplo, após importar metadados para ativos de dados, é possível adicionar metadados de negócios a esses ativos, identificar relações entre eles e analisar a qualidade dos dados desses ativos. Finalmente, é possível publicar os ativos de dados concluídos em um catálogo para compartilhar com sua organização. Antes de projetar seu enriquecimento de metadados, certifique-se de entender as implicações de suas opções para seu plano de curadoria geral..
- Configuração do projeto
- Escopo de enriquecimento
- Objetivos de enriquecimento
- Seleção de categoria
- Amostragem
- Planejamento de enriquecimento
Configuração do projeto
Selecione ou crie o projeto no qual você deseja trabalhar. Lembre-se de que os projetos marcados como confidenciais não permitem a publicação em catálogos ou o download de dados. Portanto, eles não são adequados se você quiser compartilhar os ativos enriquecidos ou baixar os resultados para análise em uma planilha.
Como administrador do projeto, defina as configurações de enriquecimento padrão que se aplicam a todos os enriquecimentos de metadados no projeto selecionado. É possível sobrescrever algumas dessas configurações ao criar ou editar seu enriquecimento de metadados.
Âmbito do enriquecimento
Geralmente, a primeira etapa quando você enriquece metadados é selecionar os dados que você deseja enriquecer É possível enriquecer ativos de dados estruturados e relacionais.
O enriquecimento de metadados é executado em ativos que estão disponíveis no projeto.. Assim, a lista de ativos enriquecidos nos resultados de enriquecimento pode não corresponder ao escopo configurado de ativos de importação de metadados incluídos nestes casos:
- A Metadata import ainda não foi concluída quando o enriquecimento foi iniciado
- Metadata import falhou para um conjunto de ativos ou falhou completamente.
Escopo de dados iniciais
A lista Recursos de dados mostra todos os recursos dos formatos suportados. É possível selecionar ativos individuais, mas também é possível selecionar ativos de importação de metadados para enriquecer o conjunto inteiro de ativos de dados dessas importações de metadados. No entanto, não é possível selecionar ativos de dados ou importações de metadados que já estejam incluídos em outro enriquecimento de metadados. Para os ativos de dados individuais, é possível passar o mouse sobre o nome do ativo para ver em qual enriquecimento de metadados o ativo está incluído
Um ativo de importação de metadados é automaticamente excluído do escopo de seleção nestes casos:
- Ele tem um catálogo como o destino de importação
- Ele foi executado em uma conexão que não suporta o acesso aos dados reais.
Veja Importando metadados.
Se alguma das conexões para os ativos de dados selecionados estiver configurada para usar credenciais pessoais em vez de compartilhadas, deve-se desbloquear essa conexão antes de poder continuar.
Também é possível criar um ativo de enriquecimento de metadados vazio e configurar o escopo posteriormente..
Âmbito das reexecuções do enriquecimento
Para novas execuções do enriquecimento, se planejado ou executado manualmente, o escopo de dados pode ser todos os ativos do escopo de dados inicialmente selecionado ou um subconjunto de ativos. A opção padrão é Recursos novos e modificados e ativos não enriquecidos na execução anterior. Com essa opção, os ativos são selecionados para enriquecimento da seguinte forma:
- Ativos que foram incluídos após a última execução do enriquecimento
- Ativos em que colunas foram incluídas ou removidas após a última execução do enriquecimento
- Ativos em que as descrições de ativo ou coluna foram alteradas após a última execução do enriquecimento
- Ativos para os quais o enriquecimento anterior falhou ou foi cancelado
O enriquecimento é sempre executado em todo o ativo de dados, independentemente de um ativo ser novo ou modificado.
O registro de execução de trabalho mostra reexecuções de enriquecimentos de metadados configurados com o escopo de dados limitado como execuções de trabalho de enriquecimento de metadados delta.
Objetivos de enriquecimento
É possível escolher entre estes objetivos de enriquecimento:
- Dados do perfil
- Expandir metadados
- Designar termos e classificações
- Configurar relacionamentos
- Identificar verificações da qualidade de dados
- Executar verificações de qualidade dos dados
- Avalie a qualidade dos dados com SLAs
Dados do perfil
Gera estatísticas básicas sobre o conteúdo do ativo, atribui e sugere classes de dados.
Esse tipo de perfil é rápido, mas faz algumas aproximações para determinadas métricas, como distribuição de frequência e exclusividade. Para obter resultados mais exatos sem aproximação, execute a criação de perfil avançada em ativos de dados selecionados Consulte Perfil de dados avançados. Para obter mais informações sobre as estatísticas, consulte Resultados detalhados do perfil.
As classes de dados descrevem os conteúdos dos dados na coluna: por exemplo, cidade, número da conta ou número do cartão de crédito. Classes de dados podem ser usadas para mascarar dados com regras de proteção de dados ou para restringir o acesso a ativos de dados com políticas. Além disso, eles podem contribuir para designações de termo se uma classe de dados correspondente para ligação de termo existir.
A confiança de uma classe de dados é a porcentagem de valores não nulos que correspondem à classe de dados. A pontuação de confiabilidade para uma classe de dados a ser designada ou sugerida deve ser pelo menos igual ao limite configurado. Consulte Configurações de Designação de Classe de Dados Se um limite for configurado diretamente em uma classe de dados, esse limite terá precedência quando classes de dados forem designadas. Ele não é considerado para sugestões. Além da pontuação de confiança, a prioridade de uma classe de dados é considerada.
Várias classes de dados são identificadores mais genéricos que são detectados e designados em um nível de coluna. Essas classes de dados são designadas quando uma classe de dados mais específica não pôde ser identificada em um nível de valor. Os identificadores genéricos sempre têm uma confiança de 100% e incluem as seguintes classes de dados: código, identificador, indicador, quantidade e texto.
As chaves primárias de coluna única são sugeridas com base em estatísticas de criação de perfil Se as restrições de chave primária e de chave estrangeira já estiverem definidas em seus dados e essas informações estiverem incluídas na importação de metadados, essas chaves serão designadas automaticamente
A partir dos resultados de enriquecimento, é possível executar uma análise de chave primária de várias coluna na qual os dados reais são verificados Para obter informações adicionais, consulte Identificando chaves primárias.
Expandir metadados
Gerar nomes e descrições semânticas para ativos e colunas de dados. Os nomes existentes na fonte podem ser expandidos com o uso de IA generativa. Como alternativa, os nomes podem ser expandidos com base nos metadados coletados e em um glossário predefinido usando a correspondência difusa e comparando os nomes com a abreviação do termo comercial nas categorias selecionadas para o enriquecimento. Se o nome do ativo ou da coluna na fonte puder ser associado a uma abreviação de termo comercial, o termo comercial correspondente será usado como o nome de exibição.
A IA generativa também é usada para fornecer descrições com base nos nomes expandidos, nas colunas adjacentes e no contexto dos ativos de dados. Use esta opção para fornecer nomes alternativos que são mais fáceis de consumir do que os nomes originais geralmente muito técnicos. As descrições geradas por IA podem ajudar a entender o conteúdo, especialmente quando as descrições de coluna ou de ativo de dados estão ausentes na origem de dados Os limites de designação e de sugestão são definidos nas configurações de enriquecimento padrão
Verifique as configurações de enriquecimento de um projeto para ver quais opções estão configuradas para essa opção de enriquecimento:
- O método de geração selecionado para nomes de exibição
- Se há contexto adicional disponível para gerar nomes usando IA generativa
- Se a geração de descrições está ativada
- Os limites de sugestão e atribuição para nomes e descrições gerados
Designar termos e classificações
Atribua automaticamente termos comerciais a colunas e ativos inteiros ou sugira termos comerciais para atribuição manual. Essas designações ou sugestões são geradas por um conjunto de serviços. Consulte Designação de termo automática
Dependendo de quais serviços de designação de termo estão ativos para o seu projeto, designação de termo pode requerer a definição de perfis.
Para a atribuição de termos com base em IA geral, o modelo de base e o idioma de saída a serem utilizados são definidos nas configurações de inteligência de dados.
Além disso, atribua classificações a ativos e colunas de dados com base em termos e classes de dados atribuídos automaticamente. A atribuição de classificação deve estar ativada nas configurações de enriquecimento padrão. A atribuição de classificação com base em classes de dados também requer a criação de perfis.
Configurar relacionamentos
Usa estatísticas de criação de perfil e similaridades de nome entre colunas para fornecer chaves primárias e estrangeiras e sugerir ou designar relacionamentos entre ativos e colunas. As configurações de enriquecimento padrão para relacionamentos chave são aplicadas. Esse tipo de análise de relacionamento requer a criação de perfil
Esta operação analisa todas as colunas dos ativos no escopo de dados do enriquecimento de metadados e pode levar um tempo considerável quando há muitos ativos. Para reduzir o tempo de processamento, execute uma rodada inicial de enriquecimento sem a opção “Definir relações ”. Em seguida, selecione um subconjunto de ativos dos resultados e execute novamente o enriquecimento de metadados utilizando apenas a opção “Definir relações ”. Certifique-se de que o escopo das repetições esteja definido como “Todos os ativos de dados” para esse fim.
Identificar verificações da qualidade de dados
Identifica e cria verificações de qualidade de dados aplicáveis para ativos e colunas de dados. Os tipos de verificações que podem ser gerados e suas origens variam de acordo com a edição instalada do IBM watsonx.data intelligence. Por padrão, as origens das verificações e os tipos de verificações definidos nas configurações de enriquecimento padrão são considerados para a geração de verificações de qualidade de dados. Você pode personalizar as configurações de cada tarefa de enriquecimento de metadados. Para obter mais informações sobre as configurações padrão, consulte Configurações de enriquecimento padrão.
Para que as verificações sejam geradas com base nos resultados da análise de perfis, os perfis de dados já devem existir ou ser criados na mesma execução da tarefa de enriquecimento. Da mesma forma, para que as verificações sejam geradas com base em restrições de termos de negócios, esses termos já devem estar atribuídos aos ativos de dados e às colunas, ou devem ser criados na mesma execução da tarefa de enriquecimento.
Ao selecionar esse objetivo, você pode substituir as configurações de enriquecimento padrão. Selecione os tipos de cheques que você deseja que sejam identificados e sugeridos. Você também pode alterar a seleção das origens dos cheques.
Executar análise de qualidade de dados
Execute todas as verificações de qualidade de dados ativadas para os ativos e colunas de dados no enriquecimento de metadados. Cada verificação pode contribuir para os núcleos de qualidade de dados gerais do ativo Certifique-se de que existam verificações de qualidade de dados para os ativos e as colunas no enriquecimento de metadados. Caso contrário, a análise da qualidade dos dados e as avaliações subsequentes do SLA de qualidade dos dados não apresentarão resultados.
É possível escolher se você deseja gravar a saída dessas verificações em um banco de dados Se as configurações padrão existirem, as seções serão preenchidas adequadamente. Você pode substituir essas configurações. Se não existir nenhuma configuração padrão, configure a saída e o local de saída Para obter informações sobre quais origens de dados são suportadas como destino de saída, consulte a coluna Tabelas de saída em Origens de dados suportadas. Os nomes de esquema e tabela devem seguir esta convenção:
- O primeiro caractere para o nome deve ser um caractere alfabético
- O resto do nome pode consistir em caracteres alfabéticos, caracteres numéricos ou sublinhados.
- O nome não deve conter espaços.
Se você selecionar para gravar as exceções ou as linhas nas quais os problemas foram localizados (registros de exceções) nas tabelas existentes, certifique-se de que essas tabelas tenham o formato necessário. Consulte Saída de Qualidade de Dados
Se a conexão que você escolher estiver bloqueada, será solicitado que você insira as suas credenciais pessoais Essa é uma etapa única que desbloqueia permanentemente a conexão para você.
Avalie a qualidade dos dados com SLAs
Verifica se a qualidade dos dados está em conformidade com os contratos de nível de serviço de qualidade de dados definidos. Os SLAs de qualidade de dados definem limites de qualidade para ativos de dados ou colunas dentro desses ativos. Com essa opção de enriquecimento, os ativos de dados incluídos no enriquecimento de metadados são verificados em relação aos critérios de seleção estabelecidos nos acordos de nível de serviço (SLA) de qualidade de dados. Se os ativos de dados ou colunas individuais corresponderem aos critérios de seleção de um SLA de qualidade de dados, sua qualidade será verificada em relação aos limites de qualidade definidos nesse SLA.
Como resultado de uma execução de enriquecimento com essa opção, é gerado um relatório de conformidade com o SLA para cada ativo de dados no processo de enriquecimento, independentemente de ter havido violação de alguma condição do SLA de qualidade de dados. Os relatórios de conformidade com o SLA fazem parte das informações de qualidade de um ativo de dados que estão disponíveis nos resultados do enriquecimento ou na página de qualidade de dados do ativo em um projeto.
Dependendo da configuração de um SLA de qualidade de dados, um fluxo de trabalho de correção de qualidade de dados pode ser iniciado caso um ativo de dados viole essa regra.
Se você combinar esse objetivo com outros objetivos, as seguintes considerações se aplicam:
- Se o objetivo de dados de perfil também for selecionado, a avaliação do SLA de qualidade de dados será executada somente se a criação de perfil for concluída com êxito.
- Se o objetivo Atribuir termos e classificações também for selecionado, a avaliação do SLA de qualidade de dados será executada somente se a atribuição de termos for concluída com êxito. Como a atribuição de prazo requer a criação de perfil de dados, a criação de perfil também deve ter sido concluída successfully.- Se o objetivo Executar verificações de qualidade de dados também for selecionado, a avaliação do SLA de qualidade de dados será executada somente após a execução de todas as verificações de qualidade de dados.
Em geral, se a avaliação do SLA de qualidade dos dados for combinada com outros objetivos de enriquecimento, a avaliação será sempre a última etapa de enriquecimento.
Você pode executar o enriquecimento de metadados tendo como único objetivo a avaliação do SLA de qualidade dos dados. No entanto, antes de fazer isso, confirme se os ativos de dados ou as colunas no escopo de enriquecimento têm termos atribuídos e têm uma pontuação de qualidade de dados. Além disso, o escopo de dados das repetições deve ser definido como Todos os ativos de dados nesse caso.
Seleção de categoria
Selecione as categorias para determinar as classes de dados, os termos comerciais e as classificações que podem ser aplicados durante o enriquecimento. Um administrador de projeto pode ter limitado o conjunto de categorias a escolher, a partir de quando é criado um enriquecimento. No entanto, você só pode escolher entre as categorias nas quais seja colaborador com, no mínimo, a função de Visualizador.
Selecione apenas as categorias com artefatos de controle que sejam relevantes para seu caso de uso
Esta seleção aplica-se apenas a designações e sugestões automáticas. Ao designar manualmente termos ou classes de dados, pode-se escolher entre todas as categorias às quais você tem acesso.
Para evitar a criação de duplicatas durante a geração de termos, os termos de negócios dessas categorias são levados em consideração nesse processo.
Mudanças no conjunto de categorias para escolher a partir ou a seleção de categoria real se tornam efetivas com a próxima execução de enriquecimento. No entanto, as designações existentes permanecem sem modificações.
Se seu acesso a qualquer uma das categorias selecionadas for revogado após a execução do enriquecimento de metadados e você não fizer nenhuma mudança no enriquecimento, qualquer nova execução ainda considerará todas as categorias selecionadas para a classe de dados e as designações de termo
Se uma categoria que você deseja remover do escopo, ou uma de suas subcategorias, servir como categoria principal para termos comerciais gerados, você pode mantê-la como categoria principal ou removê-la. Se você removê-la, deverá selecionar uma nova categoria principal para os termos gerados.
Categoria primária para termos gerados
Selecione uma categoria principal para armazenar os termos gerados. Por padrão, esta categoria não faz parte do escopo de categorias para o enriquecimento de metadados. Se você quiser que os termos gerados nesta categoria sejam considerados em execuções de enriquecimento posteriores, pode adicionar a categoria ao escopo.
Amostragem
É possível realizar certos tipos de análise, como análise de perfil ou análise de chaves, em uma amostra de ativos de dados, por exemplo, para fins de desempenho ou triagem.
É possível escolher entre esses tipos de amostragem:
- Básico
A amostragem básica funciona com o menor tamanho de amostra possível para acelerar o processo: 1.000 linhas por tabela são analisadas e a classificação é feita com base nos 100 valores mais frequentes por coluna.
- Moderar
A amostragem moderada trabalha com um tamanho de amostra médio para fornecer resultados razoavelmente precisos sem ser muito demorado: 10.000 linhas por tabela são analisadas, e a classificação é feita com base nos 100 valores mais frequentes por coluna..
- Abrangente
A amostragem abrangente trabalha com um tamanho de amostra grande para fornecer resultados mais precisos: 100.000 linhas por tabela são analisadas e a classificação leva todos os valores por coluna em consideração. No entanto, este método é mais intensivo em consumo de recursos.
- Customizado
Defina o método de amostragem, o tamanho da amostra e a base para a classificação:
Escolha entre a amostragem sequencial e aleatória Com uma amostragem sequencial, as primeiras linhas de um conjunto de dados são selecionadas em uma ordem sequencial. Com a amostragem aleatória, as linhas a serem incluídas são selecionadas aleatoriamente Para ambos os métodos, o número máximo de linhas a serem selecionadas é determinado pelo tamanho da amostra definido
A amostragem aleatória está disponível apenas para ativos de dados de origens de dados que suportam esse tipo de amostragem. Para obter mais informações, consulte Conceitos de amostragem aleatória.
Defina o tamanho máximo de uma amostra. É possível configurar um número fixo de linhas ou especificar quantos por cento das linhas no conjunto de dados que você deseja analisar. Se você definir o tamanho da amostra como um valor de porcentagem, será possível, opcionalmente, configurar o número mínimo e máximo de linhas que a amostra pode incluir. Talvez você queira configurar esses valores quando não souber o tamanho dos conjuntos de dados a serem analisados. O número ou a percentagem de linhas selecionadas para a amostra pode apenas aproximar o valor especificado..
Selecione se você deseja que uma classe de dados seja designada com base em todos os valores em uma coluna ou nos valores mais frequentes em uma coluna em que é possível especificar o número de valores que você deseja que sejam considerados.
A amostragem básica, moderada ou abrangente é sequencial e começa na parte superior da tabela. Para suprimir a amostragem, use a amostragem customizada configurada com amostragem aleatória e um tamanho de amostra de 100%.
opções de Planejamento
Se o seu escopo de dados incluir ativos de importação de metadados, a página Schedule fornecerá informações sobre quaisquer agendamentos configurados dos respectivos trabalhos de importação de metadados. Essas informações ajudam a coordenar o seu planejamento de enriquecimento com quaisquer planejamentos de importação.
Executar a definição
Definir quando o enriquecimento de metadados é executado. Você pode selecionar nenhuma, uma ou ambas as opções:
- Executar após a criação da tarefa
Selecione essa opção para executar o enriquecimento de metadados quando você salvar um enriquecimento de metadados recém-criado. Caso contrário, o ativo de enriquecimento de metadados é salvo, mas nenhuma execução de trabalho é iniciada.
- Executar em um planejamento
Selecione essa opção para executar o enriquecimento em uma programação. É possível planejar execuções únicas e recorrentes. Defina a data e a hora de início da programação. Se você planejar uma única execução, a tarefa será executada exatamente uma vez no dia e hora especificados..
Para programar execuções recorrentes, selecione Repetir o trabalho e a frequência na qual você deseja que o trabalho de enriquecimento seja executado. Se você selecionar Minutely (Minuto), Hourly (Hora) ou Daily (Diário), poderá excluir determinados dias da semana da programação. Opcionalmente, você pode definir uma data e hora de término para o agendamento de tarefas. Para execuções recorrentes, o trabalho é executado pela primeira vez no registro de data e hora calculado com base nas configurações da seção Repetir o trabalho.
Independentemente da definição de execução, você pode acionar manualmente uma execução do trabalho de enriquecimento de metadados a qualquer momento.
Se as janelas de execução de trabalho forem configuradas para um projeto, as execuções de trabalhos de enriquecimento de metadados serão restritas aos períodos de tempo configurados. As execuções de trabalho serão iniciadas conforme solicitado, ou seja, sob demanda, após a criação do ativo de enriquecimento de metadados ou na programação definida, mas serão pausadas imediatamente se a data e a hora de início estiverem fora de uma janela de execução e retomadas quando a próxima janela de execução de trabalho for aberta. Os enriquecimentos de metadados de longa duração podem ser pausados e retomados várias vezes.
Para obter mais informações, consulte Janelas de execução de trabalhos.