Projetando importações de metadados

Ao importar metadados, você deve decidir o tipo de metadados a serem importados, o destino e o escopo da importação, se deve agendar trabalhos de importação e como deseja personalizar o comportamento da importação.

Metas de importação

A primeira etapa ao importar metadados é definir as metas de importação. É preciso decidir que tipo de metadados importar e se deseja trabalhar com os ativos importados em um projeto ou publicá-los diretamente em um catálogo.

Normalmente, a importação de metadados faz parte de um plano maior de curadoria de dados. Por exemplo, depois de importar metadados para ativos de dados, você pode adicionar metadados comerciais aos ativos de dados importados executando o enriquecimento de metadados. Você também pode executar regras de qualidade de dados. Por fim, você pode publicar os ativos de dados concluídos em um catálogo para compartilhar com sua organização. Antes de projetar a importação de metadados, certifique-se de entender as implicações de suas escolhas no plano geral de curadoria. Consulte Planejamento para curadoria.

Por exemplo, um processo típico de curadoria de ativos de dados inclui as seguintes tarefas:

  1. Execute a importação de metadados com a opção Importar metadados de ativos para adicionar ativos de dados a um projeto.
  2. Execute o enriquecimento de metadados nos ativos de dados para criar um perfil de seus dados, fazer uma análise básica da qualidade dos dados e fornecer contexto comercial por meio da atribuição de termos.
  3. Execute regras de qualidade de dados nos ativos.
  4. Publique os ativos em um catálogo.
  5. Execute a importação de metadados para os mesmos ativos de dados com a opção Importar metadados de linhagem para adicionar informações de linhagem a esses ativos no catálogo.

Você pode adicionar outros tipos de ativos diretamente a um catálogo porque o enriquecimento de metadados e a avaliação da qualidade dos dados não são aplicáveis. Você pode escolher as opções Importar metadados de ativos e Importar metadados de linhagem para importar simultaneamente metadados técnicos e de linhagem para ativos enquanto adiciona esses ativos a um catálogo.

Você pode escolher entre os seguintes métodos de importação:

Importar metadados de ativos
Os metadados técnicos de ativos fornecem informações sobre detalhes de ativos, relacionamentos e visualização de ativos. Você pode adicioná-lo a um projeto para processamento posterior ou pode publicá-lo em um catálogo imediatamente após a importação.
Importar metadados de linhagem
Os metadados de linhagem fornecem informações sobre o fluxo de dados, de onde eles vêm, como mudam e para onde se deslocam ao longo do tempo. Os metadados da linhagem são armazenados no repositório de linhagem.

Importar destino

Você pode importar metadados para o projeto em que está trabalhando ou para qualquer catálogo em que tenha uma função de editor ou administrador.

Projetos

Em projetos, você pode executar regras de enriquecimento de metadados e de qualidade de dados em ativos de dados. Você publica os ativos de dados importados em um catálogo depois de estar satisfeito com as atribuições de metadados comerciais e a qualidade dos dados.

As informações de linhagem estão disponíveis em catálogos e projetos. As informações de linhagem só estarão disponíveis em projetos se os ativos tiverem linhagem importada usando a Metadata import.

Se o seu projeto estiver marcado como sensível, você poderá importar metadados somente para o projeto, não para um catálogo. Para obter mais informações, consulte Marcação de um projeto como sensível.

Catálogos

Se você conhecer bem o conteúdo dos ativos de dados e não quiser executar regras de enriquecimento de metadados ou de qualidade de dados, poderá importar seus metadados diretamente para o catálogo. Depois que a importação for concluída, os ativos estarão disponíveis publicamente no catálogo selecionado.

Você pode importar metadados para qualquer catálogo no qual tenha uma função de editor ou administrador, exceto quando o catálogo fizer parte de um projeto marcado como confidencial.

Se você importar para um catálogo, certifique-se de que o catálogo de destino tenha o tratamento de ativos duplicados definido para atualizar os ativos originais em vez de permitir ativos duplicados. Consulte Manuseio de ativos duplicados.

Se quiser que as regras de proteção de dados sejam aplicadas aos ativos de dados importados, você deverá selecionar um catálogo governado como destino da importação.

Origem de dados

Para obter a lista de fontes de dados compatíveis, consulte Fontes de dados compatíveis para curadoria e qualidade de dados.

Para se conectar à fonte de dados, você deve especificar os seguintes detalhes:

  • Definição da fonte de dados. É obrigatório quando você importa metadados de linhagem e opcional quando você importa metadados de ativos. Ele é usado para identificar exclusivamente uma fonte de dados usando pontos de extremidade. Os pontos de extremidade incluem informações como o nome do host ou o endereço IP, o número da porta e o nome do banco de dados ou o identificador da instância. Por exemplo, quando você tem vários bancos de dados Microsoft SQL Server, a definição da fonte de dados identifica um deles. Ou quando o cluster Teradata contém vários nós com vários nomes de host, a definição da fonte de dados identifica o cluster inteiro como uma entidade. Para obter mais informações, consulte Criação de uma definição de fonte de dados.

  • Scanner. Ele é usado para extrair e processar metadados para criar linhagem. Você seleciona um scanner quando a fonte de dados da qual a linhagem é importada pode hospedar metadados de várias tecnologias. Por exemplo, Microsoft SQL Server pode ser usado como um armazenamento de metadados para o Microsoft SQL Server Integration Services. Nesse caso, os metadados de linhagem podem ser importados do banco de dadosMicrosoft SQL Server) ou de trabalhos de ETLMicrosoft SQL Server Integration Services). Você seleciona um scanner para importar o tipo específico de metadados de linhagem.

  • conexão. Os detalhes da conexão incluem credenciais. É possível criar várias conexões para uma fonte de dados, por exemplo, para se conectar usando diferentes nomes de host ou para se conectar a várias contas de usuário com privilégios específicos. Os detalhes necessários para se conectar a uma fonte de dados específica são descritos em cada tópico de conexão na seção Conectores e na seção Conectores suportados para importação de linhagem. Ao importar metadados de ativos, você deve selecionar uma definição de fonte de dados ou uma conexão. Para obter mais informações, consulte Adição de conexões a fontes de dados em um projeto.

Definição da fonte de dados e conexão na importação
de linhagem Ao importar metadados de linhagem, é necessário selecionar tanto a definição da fonte de dados quanto uma conexão. Ao selecionar uma conexão para a qual ainda não foi definida uma definição de fonte de dados, é possível criar uma diretamente no assistente de importação de metadados. Os detalhes da definição da fonte de dados são preenchidos automaticamente com os valores definidos para a conexão. Se não houver nenhuma conexão criada para a definição da fonte de dados selecionada, você pode criar a conexão diretamente no assistente de importação de metadados.

Nota:

A conexão deve ser atribuída a uma definição de fonte de dados. Se você criar primeiro uma definição de fonte de dados e depois uma conexão, crie a atribuição manualmente. Consulte Adição de endpoints a uma definição de fonte de dados nova ou existente.

Modo de conexão

Você pode importar metadados de linhagem conectando-se diretamente do site Cloud Pak for Data a uma fonte de dados ou usando agentes para se conectar remotamente. Instale o agente diretamente na fonte de dados externa e registre-o em Cloud Pak for Data. Em seguida, você pode selecioná-lo ao criar uma importação de metadados de linhagem. Para obter mais informações, consulte Configuração de agentes para importação de metadados de linhagem.

Escopo da importação

Decida o escopo dos dados que você deseja importar. Dependendo do tamanho e do conteúdo da sua fonte de dados, talvez você não queira importar todos os ativos, mas um subconjunto selecionado. É possível incluir esquemas ou pastas completas, ou realizar drill down em tabelas ou arquivos individuais. Ao selecionar um esquema ou uma pasta, é possível ver imediatamente quantos itens ela contém. Assim, é possível decidir se você deseja incluir todo o conjunto ou se um subconjunto serve melhor ao seu propósito.

Não é possível importar dados de esquemas em que o nome contém caracteres especiais.

Listas de inclusão e exclusão de metadados de linhagem

Ao definir um escopo para extrair metadados de linhagem, você pode adicionar uma lista de ativos para incluir na extração ou excluir da extração. Essa lista geralmente é uma expressão regular e seu formato é específico para a fonte de dados selecionada. Para obter detalhes, consulte um tópico de conexão específico na seção Conectores compatíveis para importação de linhagem.

Entradas externas

Ao importar metadados de linhagem, você pode fornecer entradas manuais adicionais para algumas fontes de dados, de modo que a linhagem final contenha dados mais completos. Você tem a seguinte opção:

Adicionar entradas do arquivo Normalmente, você adiciona um arquivo.zip com uma estrutura que atende aos requisitos de uma fonte de dados específica. Os requisitos de estrutura são explicados em detalhes em cada tópico de conexão na seção Conectores suportados para importação de linhagem. Se quiser usar um arquivo de um projeto, você deve importar o arquivo para o projeto primeiro. No projeto, na guia Assets (Ativos ), importe o arquivo em Import assets (Importar ativos) > Local file (Arquivo local) > Data asset (Ativo de dados ). Você também pode adicionar um arquivo para importar diretamente ao criar uma importação de metadados, usando a opção “Carregar arquivo ”.

Substituições de sinalizador

Ao adicionar entradas externas para linhagem, você pode substituir valores de espaço reservado, como variáveis de ambiente, por valores reais a serem usados na análise de linhagem. A tabela a seguir contém exemplos de como a exibição de dados pode ser modificada para análise de linhagem.

Escopo de substituição Formato de processamento de escopo Valor do sinalizador Valor de substituição
(A expressão regular não é selecionada, é usado texto simples) ${table_name} clientes
*bteq Expressão Regular ${db} dwh

Outra maneira de fornecer substituições para os espaços reservados é criando um arquivo ` CSV ` e adicionando-o ao arquivo.zip que você enviar como entrada externa. Esse arquivo deve ser chamado de ' replace.csv e deve ter a seguinte estrutura:

"PLACEHOLDER","REPLACEMENT_VALUE"[,SCOPE]

Em que:

  • PLACEHOLDER é o valor que você deseja substituir.
  • REPLACEMENT_VALUE é o novo valor que substitui o valor original.
  • SCOPE é um filtro para aplicar a substituição somente nos ativos selecionados. Essa coluna é opcional. Ela é interpretada como uma expressão regular. O exemplo de caminho que pode ser usado nesse arquivo é ' \MyBD\MySchema\MyScript.sql.

Cada par de substituição deve ser colocado em uma linha separada. Cada valor deve ser colocado entre aspas duplas ("").

opções de Planejamento

Se você não definir uma programação, a importação será executada quando você salvar inicialmente o ativo de importação de metadados. É possível executar novamente a importação manualmente a qualquer momento.

Se você selecionar para executar a importação em um planejamento específico, defina a data e o horário em que deseja que a tarefa seja executada. Talvez você queira coordenar a importação programada de metadados e os trabalhos de enriquecimento de metadados correspondentes para os mesmos ativos.

Se você selecionar para executar a importação em um planejamento específico, defina a data e o horário em que deseja que a tarefa seja executada. É possível planejar execuções únicas e recorrentes. Se você programar uma execução única, o trabalho será executado exatamente uma vez no dia e na hora especificados. Se você programar execuções recorrentes, o trabalho será executado pela primeira vez no carimbo de data/hora indicado na seção Recurrence (Recorrência ).

O nome padrão do trabalho de importação é metadata_import_name job. Ao configurar a importação de metadados, você pode alterar o nome para se adequar ao seu esquema de nomenclatura. No entanto, não é possível alterar o nome posteriormente. Você pode acessar o trabalho de importação que criou no ativo de importação de metadados ou na página Trabalhos do projeto. Consulte Tarefas.

Você pode atualizar a programação de uma importação de metadados editando o ativo de importação de metadados.

Fases da importação de linhagem

A importação de metadados de linhagem é um processo que tem várias fases. Para otimizar a importação de acordo com suas necessidades, você pode decidir quais fases serão executadas com cada trabalho de importação de metadados. Por exemplo, você pode executar somente a fase de extração nas conexões selecionadas que foram atualizadas recentemente para melhorar o desempenho. Depois que essa fase for concluída, você poderá executar a análise em tudo: as conexões atualizadas e as que foram extraídas anteriormente.

Observação: É necessário executar as fases de extração antes de executar as fases de análise.

A lista a seguir fornece uma breve explicação sobre quais processos são executados em cada fase de importação de linhagem:

Extração de dicionário
Extrai e importa ativos de linhagem (tabelas, visualizações, sinônimos e outros) para o repositório de linhagem.
Extração de transformações
Extrai definições de transformações da origem de dados.
Análise de entradas extraídas
Analisa a linhagem de dados para transformações extraídas automaticamente.
Ingestão de entradas externas
Ingere entradas externas de um sistema de arquivos de agente ou de um repositório Git.
Análise de entrada externa
Analisa a linhagem de dados para entradas externas que foram ingeridas ou transferidas por upload por uma tarefa de importação de metadados.

Opções de importação avançadas

É possível personalizar o comportamento geral da importação e o que acontece com os ativos importados quando você executa novamente uma importação de metadados.

Opções de importação de metadados de ativos

Impedir que propriedades específicas sejam atualizadas

Por padrão, todas as propriedades do ativo são atualizadas quando os ativos são reimportados. Se você não quiser que os nomes dos ativos, as descrições dos ativos ou as descrições das colunas sejam atualizadas na reimportação, desmarque as respectivas caixas de seleção na lista Atualizar na reimportação.

Excluir ativos existentes que não estão incluídos na reimportação

Por padrão, nenhum ativo é excluído do projeto ou catálogo de destino quando você executa novamente a importação. Para limpar o projeto ou catálogo de destino, selecione uma das opções Excluir na reimportação.

  • Ativo não encontrado na fonte de dados ou excluído da importação: Nesses casos, exclua os ativos importados anteriormente do destino de importação quando a importação for executada novamente:
    • O ativo não está mais disponível na fonte de dados.
    • A configuração Excluir da importação foi alterada para a reexecução, de modo que o ativo agora está excluído da importação (aplicável somente para importações de metadados que você executa em bancos de dados relacionais).
  • Ativo removido do escopo de importação: Exclua os ativos que foram removidos do escopo desses metadados após a última execução do destino de importação quando a importação for executada novamente.

Além disso, os ativos excluídos no projeto de destino não serão excluídos do catálogo se tiverem sido publicados anteriormente nele. Para o catálogo de destino, independentemente da seleção, os ativos não serão excluídos, mas sim marcados Removed.

Não importar tipos específicos de ativos relacionais

Para importações de metadados executadas em bancos de dados relacionais, na configuração Excluir da importação, você pode selecionar se deseja importar todos os tipos de ativos relacionais ou se deseja excluir tabelas ou exibições, aliases e sinônimos. Essas opções são mutuamente exclusivas.

Importar propriedades adicionais de ativos

Para importações de metadados que você executa em bancos de dados relacionais, é possível selecionar se as chaves primárias e estrangeiras que podem ser definidas no banco de dados serão importadas.

Habilitar opções adicionais de importação

Ative as importações incrementais para importar apenas ativos de dados novos ou modificados quando você executar novamente a importação. Essa opção está disponível somente para importações de metadados que você executa em bancos de dados relacionais e onde a fonte de dados selecionada suporta importações incrementais:

A atualização ou remoção da descrição de um ativo na fonte de dados não altera a data de modificação do ativo. A data de modificação também não é alterada para ativos que são removidos da lista de ativos importados. Portanto, esses ativos não são considerados para importações incrementais. Além disso, os ativos que são excluídos da fonte de dados ou do escopo não são detectados com as importações incrementais. Portanto, esses ativos não são marcados como Removidos ou excluídos conforme especificado nas configurações de Excluir na reimportação. Para ver essas alterações refletidas, desative as importações incrementais para reimportar todos os ativos no escopo de dados.

Importante:

As importações incrementais podem não funcionar se a fonte de dados e o data center IBM Cloud estiverem em fusos horários diferentes. Se o data center estiver em um fuso horário anterior ao fuso horário da fonte de dados, o trabalho de importação de metadados poderá não detectar ativos que foram adicionados ou modificados após a última execução de importação. Nesse caso, desative a importação incremental para que todos os ativos sejam incluídos quando você executar novamente a importação.
Para que as importações incrementais funcionem, a fonte de dados deve estar no fuso horário GMT, independentemente do fuso horário do data center.

Coletar metadados do catálogo do banco de dados

Para importações de metadados executadas em bancos de dados relacionais, você pode optar por importar metadados do catálogo do banco de dados. Assim, o usuário que executa a importação precisa acessar apenas o catálogo do banco de dados, mas não precisa ter permissão SELECT nos dados reais. Os ativos importados não podem ter o perfil definido ou ser usados no enriquecimento de metadados.

Importar o registro de data e hora do ativo

Você pode incluir as informações sobre a hora em que o ativo foi modificado pela última vez. O atributo " metadata_modification_token é adicionado à propriedade " extended_metadata de um ativo.

Expandir importação de ativos

Selecione os tipos de ativos a serem importados. Normalmente, os tipos de ativos mais comuns são importados por padrão. Se você quiser importar mais tipos de ativos, selecione-os. Os tipos dependem da fonte de dados.

Opções de importação de metadados de linhagem

As opções avançadas de linhagem dependem da fonte de dados que você selecionar. Para obter detalhes, consulte um tópico de conexão específico na seção Conectores compatíveis para importação de linhagem.

Saiba Mais

Planejamento para curadoria