Planejamento para curar dados em catálogos

O processo de curadoria inclui a criação de ativos de dados, designando artefatos de governança e outros metadados para os ativos de dados, publicando os ativos de dados em um catálogo e, em seguida, atualizando metadados de ativos como os dados subjacentes ou seu vocabulário de negócios muda. Após seus encaminhais de dados adicionar ativos de dados de alta qualidade e enriquecidos a catálogos, os consumidores de dados podem encontrar e utilizar esses ativos de dados.

Embora você possa curar ativos de dados individualmente, esse processo não é escalável. É possível automatizar muitas tarefas de curadoria com as ferramentas de enriquecimento de Metadata import e Metadata, com as quais é possível descobrir, criar, enriquecer e publicar conjuntos de ativos de dados.

Para automatizar a curadoria de dados o máximo possível, complete essas tarefas para configurar um projeto de curadoria, inclua ativos de dados curados em um catálogo e atualize os ativos de dados para manter a corrente de metadados:

Tarefa Obrigatório? Frequência
Configurar um projeto True Única
Adicionar conexões a fontes de dados True Única
Importar metadados para criar ativos de dados True Recorrente
Enrico ativos de dados com metadados e outras informações True Recorrente
Resolver dados da entidade para criar uma visualização de 360 graus de seus dados Não Recorrente
Customizar análise de qualidade de dados Não Recorrente
Publicar ativos de dados em catálogos True Recorrente
Importar linhagem para ativos de dados Não Recorrente

O ciclo de dados da curadoria inclui as etapas listadas na tabela.

Quando você cria ativos de importação de metadados e de enriquecimento de metadados, você pode programá-los para executar automaticamente ou executá-los sob demanda. Você pode configurar planejamentos de tarefas na UI ou com APIs. Por exemplo, é possível programar uma importação de metadados para um horário e data específicos. Em seguida, é possível programar o enriquecimento de metadados para que os mesmos ativos sejam executados após a conclusão da importação de metadados. Após o enriquecimento de metadados estiver concluído, revise os resultados, faça os ajustes necessários e, em seguida, pubque as atualizações nos ativos de dados para o catálogo.

Configurar um projeto para curadoria

Um projeto é um espaço de trabalho colaborativo onde as pessoas trabalham com dados para cumprir um objetivo compartilhado.

Para melhorar a consistência, é possível criar convenções para projetos, como:

  • Nomes do projeto: Identifique os projetos de uma maneira consistente, por exemplo, por propósito, intervalo de data ou equipe
  • Requisitos do projeto: Descreva e vincule a requisitos e tarefas em sistemas externos no arquivo Read me do projeto.
  • Nomes de conexão: Identifique conexões de maneira consistente, por exemplo, por origem de dados, nome da tabela ou propósito.

Um projeto de curadoria de dados geralmente contém os seguintes tipos de itens que são adicionados explicitamente por stewards de dados ou são criados como o resultado de um processo:

  • Ativos de conexão para as fontes de dados que contêm os dados para curadoria
  • Ativos de dados conectados que são criados por importação de metadados
  • Metadata import ativos
  • Ativos de enriquecimento de metadados
  • Definição de qualidade de dados e ativos de regras
  • DataStage ativos de fluxo que são criados executando regras de qualidade de dados
  • Ativos de dados que contêm tabelas de saída de regra de qualidade de dados
  • Ativos de dados que contêm tabelas de distribuição de frequência que são criadas por enriquecimento de metadados
  • Empregos que são criados por ativos em execução

Saiba mais sobre a criação de projetos

Adicionar conexões com fontes de dados

Antes que seus stewards de dados possam importar metadados para criar ativos de dados conectados, eles precisam dos ativos de conexão para as fontes de dados relevantes. As fontes de dados podem incluir bancos de dados, como o Db2, ou sistemas de arquivos, como o IBM Cloud Object Storage.

Geralmente, as organizações adicionam conexões com o Platform assets catalog para que todos os usuários possam localizá-los e usá-los. Por exemplo, seus engenheiros de dados podem criar os ativos de conexão no Platform assets catalog, e então todos os usuários podem facilmente adicionar essas conexões em seus projetos. Alternativamente, é possível criar conexões dentro de um projeto.

Ao criar conexões, você deve decidir como manipular credenciais de conexão. Por padrão, as credenciais de conexão são marcadas como compartilhadas, permitindo que todos os usuários usem as mesmas credenciais para acessar os dados. Se você desejar que cada usuário insira suas credenciais pessoais, desative as credenciais compartilhadas ao criar conexões No entanto, se suas conexões requerem credenciais pessoais, deve-se assegurar que seus organizadores de dados tenham credenciais para todas as conexões que eles precisam para curadoria.

O Cloud Pak for Data suporta muitas conexões, mas nem todas são suportadas para importação de metadados, enriquecimento de metadados e análise de qualidade de dados.

Saiba mais sobre a inclusão de conexões

Importar metadados para criar ativos de dados

Metadata import detecta todas as tabelas ou arquivos que são acessíveis a partir de uma conexão especificada para uma fonte de dados. Você pode optar por criar ativos de dados conectados para todos ou uma seleção das tabelas ou arquivos. O processo de importação de metadados também cria um ativo de importação de metadados que você pode reerun ou especificar como uma entrada para enriquecimento de metadados.

Geralmente, as organizações criam diversos ativos de importação de metadados para uma única fonte de dados. Cada importação de metadados contém tabelas ou arquivos que possuem uma frequência similar de mudanças para estrutura, esquema ou linhas de dados. Em seguida, é possível executar cada importação de metadados em um planejamento diferente. Por exemplo, você pode criar importações de metadados com as seguintes características:

  • Uma importação de metadados para tabelas que possuem atualizações frequentes que você planeja executar semanalmente.
  • Uma importação de metadados para tabelas com atualizações pouco frequentes que você programa para serem executadas mensalmente.
  • Uma importação de metadados para tabelas com atualizações raras que você executa manualmente quando necessário.

Importação de metadados da Rerun para detectar os seguintes tipos de alterações na origem de dados:

  • Ativos que são adicionados ou removidos
  • Esquemas de tabela que são alterados
  • Atualizações para metadados de ativos, tais como, alterações de nome ou descrições atualizadas

Depois de executar a importação de metadados rerun, reerun metadados enriquecimento.

Saiba mais sobre a importação de metadados

Enriquecer ativos de dados com metadados e outras informações

O enriquecimento de metadados adiciia informações aos seus ativos de dados conectados. Você pode facilmente executar o enriquecimento de metadados em todas as tabelas ou arquivos que você criou com importação de metadados, configurando a importação de metadados como o escopo de dados. O processo de enriquecimento de metadados também cria um trabalho de enriquecimento de metadados que você pode reerun.

Geralmente, as organizações criam um enriquecimento de metadados para cada importação de metadados. Em seguida, é possível sincronizar facilmente os planejamentos de importação de metadados e enriquecimento de metadados. No entanto, é possível criar enriquecimentos de metadados para um único ativo de dados conectado, como uma tabela virtualizada.

Quando você executa o enriquecimento de metadados em ativos de dados, as informações são adicionadas dependendo das opções de enriquecimento selecionadas:

  • Somente criação de perfil: Adiciona classes de dados e estatísticas e sugere chaves primárias.
  • Expansão de metadados: Gera nomes de exibição e descrições.
  • Geração de verificações de qualidade de dados: Identifica e adiciona automaticamente as verificações de qualidade de dados apropriadas para ativos e colunas de dados. Dependendo das origens de verificação selecionadas, devem existir resultados de criação de perfil, atribuições de termos ou atribuições de relacionamentos.
  • Análise de qualidade: Aplica verificações de qualidade de dados geradas e adicionadas manualmente para calcular e adicionar pontuações de qualidade.
  • Atribuição de termos: Atribui termos e classificações com base nos métodos selecionados. A atribuição de termos com base em relacionamentos com classes de dados requer a criação de perfis. Para os trabalhos de conclusão de curso baseados em IA, os metadados também devem ser expandidos. Em qualquer caso, os termos podem ser atribuídos por um algoritmo de aprendizado de máquina e correspondência de nomes.
  • Geração de relacionamentos: Identifica chaves primárias e externas e sugere relações entre ativos.
  • Monitoramento da qualidade dos dados: Verifica se a qualidade dos dados está em conformidade com os contratos de nível de serviço de qualidade de dados definidos e relata violações. Um fluxo de trabalho de correção pode ser acionado.

É possível equilibrar precisão versus velocidade, configurando o tamanho de amostragem dos dados. Quanto maior o tamanho de amostragem dos dados, mais precisa a classe de dados e as atribuições de termo de negócio e análise de qualidade de dados, mas o trabalho de enriquecimento de metadados mais longo dura.

Embora você possa especificar para designar classes de dados e termos de negócios automaticamente, você deve revisar os resultados. As apurações precisas de classes de dados e termos de negócios são críticas. Caso contrário, informações sensíveis podem não ser mascaradas ou protegidas por regras de proteção de dados. Atribuições precisas também garantem que as verificações corretas de qualidade de dados possam ser geradas para seus dados, o que pode ter um impacto sobre as pontuações de qualidade de dados.

Quanto mais você executa o enriquecimento de metadados e ajusta a classe de dados e designações de termo de negócio, mais preciso se torna o algoritmo de designação automático.

Execute novamente o enriquecimento de metadados com os objetivos apropriados nessas circunstâncias:

  • Após a importação de metadados rerun. Dependendo de quantas mudanças nos dados que você espera, reveja o enriquecimento de metadados em todo o escopo de dados da importação ou apenas em dados novos ou alterados, por exemplo, para captar novas tabelas ou colunas. Alterações nos valores de dados em uma coluna podem afetar pontuações de qualidade de dados ou da classe de dados e designações de termo de negócio.
  • Após alterações nas classes de dados e termos de negócio disponíveis. Mudanças nas classes de dados e termos de negócios podem afetar suas atribuições em colunas.

Os empregos de enriquecimento de metadados podem levar quantidades significativas de tempo, dependendo do tamanho de seus dados. Eles também consomem recursos de computação que são faturados em sua conta.

Saiba mais sobre os metadados enriquecidos

Resolva dados de entidade para criar uma visualização de 360 graus de seus dados

Para garantir que seus usuários e sistemas tenham uma visão completa, confiável e unificada dos dados dos seus clientes, utilize o IBM Master Data Management para harmonizar e consolidar dados provenientes de fontes diversas e estabelecer uma visão de 360 graus dos seus dados, conhecida como dados mestres.

Defina o modelo de dados para seus dados principais e, em seguida, carregue os ativos de dados de toda a empresa e mapeie-os para seu modelo. Em seguida, inicie a configuração do sistema para atender aos requisitos exclusivos de sua organização Configure o algoritmo de correspondência e execute-o para criar entidades de dados principais Revise as estatísticas e gráficos fornecidos para avaliar os resultados da correspondência. Dependendo de seus resultados, é possível ajustar ainda mais o algoritmo e melhorar seus resultados correspondentes concluindo revisões de pares ou alterando pesos e limites correspondentes.

Quando você tiver aperfeiçoado seu algoritmo de correspondência, os usuários de negócios poderão procurar e explorar seus dados principais para obter insights chave Os administradores de dados podem editar, manter e corrigir os dados e, em seguida, exportá-los como dados interligados ou no formato d CSV, para uso em outros locais.

Saiba mais sobre como resolver dados de entidade

Customizar análise de qualidade de dados

Para customizar sua análise de qualidade de dados, crie e execute regras de qualidade de dados. Cada regra de qualidade de dados se aplica aos ativos de dados de uma única origem de dados ou a um único ativo de dados de um arquivo. Você executa suas regras de qualidade de dados como DataStage fluxos, o que exige a DataStage serviço. Com DataStage, você pode executar regras de qualidade de dados nas regiões suportadas. Com o DataStage as a Service Anywhere, você pode executar regras de qualidade de dados fora do IBM Cloud usando mecanismos remotos. Para obter mais informações sobre a configuração de mecanismos remotos, consulte a documentaçãoDataStage as a Service Anywhere.

O formato e a maneira como você define as condições da regra de qualidade de dados dependem do tipo de resultados que deseja receber.

Resultados Formato Método
Retorna o grau para o qual as colunas estão em conformidade com as condições da regra Definições de qualidade de dados Você cria ativos de definição de qualidade de dados aos quais faz referência em uma ou mais regras de qualidade de dados Especifique a lógica de regra organizando elementos de bloco em uma tela ou inserindo uma expressão em um editor de formato livre.
Retorna colunas que falham condições de regra. Instruções SQL Insira instruções SQL em cada regra de qualidade de dados.

Se você criar regras de qualidade de dados que contenham definições de qualidade de dados, terá as seguintes opções:

  • Reutilizar a mesma definição de qualidade de dados várias vezes em uma regra de qualidade de dados
  • Inclua várias definições da qualidade de dados em uma regra de qualidade de dados
  • Publicar definições de qualidade de dados em um catálogo e reutilizá-las em diversos projetos.
  • Crie regras simples que liguem dados diretamente e opcionalmente crie junções para ligações.
  • Crie regras complexas nas quais os dados são pré-processados nos fluxos do DataStage e a saída pode ser roteada para os links de saída do DataStage
  • Crie junções para ligações para usar dados de várias tabelas na tabela de saída
  • Crie conjuntos de parâmetros em um projeto para gerenciar os valores literais e as colunas que você liga às variáveis de regras Também é possível publicar o conjunto de parâmetros em um catálogo e reutilizá-lo em diversos projetos
  • Configure o número máximo de registros a serem avaliados e o método de amostragem

É possível escolher enviar a saída da regra de qualidade de dados para um banco de dados externo para manter um registro detalhado dos resultados da regra. Por exemplo, você pode desejar executar relatórios ou enviar as informações para uma equipe de gerenciamento de dados para correção de qualidade

Saiba mais sobre a análise de qualidade de dados

Publicar ativos de dados em um catálogo

Você pode publicar diversos ativos de dados enriquecidos a um catálogo em uma operação a partir de dentro do ativo de enriquecimento de metadados ou da guia Ativos no projeto.

As principais diferenças entre a publicação a partir da guia Ativos e a partir de um ativo de enriquecimento de metadados estão na manipulação de ativos duplicados. A tabela a seguir compara as escolhas que você tem e seus efeitos.

Método de publicação Publicação em massa? Escolhas de manipulação duplicadas Designações de termo de negócios
Ativos guia Sim, você pode selecionar vários ativos para publicar juntos. • Atualize ativos originais
• Sobresina ativos originais
• Permitir duplicatas (se as configurações do catálogo incluem esta opção)
• Preservar ativos originais e rejeitar duplicatas
Designações originais de termo de negócios podem ser removidas.
Ativo de enriquecimento de metadados Sim, você pode selecionar vários ativos para publicar juntos. Atualizar ativos originais Os termos de negócios a partir do novo ativo são adicionados ao ativo original. Não são removidas designações de termo de negócios originais.

Saiba mais sobre a publicação em um catálogo

Linhagem de importação para os ativos de dados no catálogo

A linhagem é a informação sobre a origem de seus dados, como eles mudam e para onde se deslocam ao longo do tempo. É possível importar informações de linhagem para os ativos de dados que você importou, enriqueceu e publicou em um catálogo. A linhagem de dados deve estar ativada. Para importar a linhagem, você cria uma importação de metadados com a opção Importar metadados de linhagem. O serviço de linhagem faz a varredura da fonte de dados de destino e analisa o fluxo de dados. Esses metadados de linhagem são importados com os ativos de dados e, se disponíveis, com quaisquer scripts de transformação.

Normalmente, as organizações executam novamente a importação de metadados para capturar informações de linhagem depois de executar a importação e o enriquecimento de metadados e publicar os ativos de dados atualizados.

Saiba mais sobre a importação de linhagem

Tarefas de planejamento anteriores

Próximas tarefas de planejamento