Configuração de agentes para importação de metadados de linhagem

Configure agentes Manta no mesmo local ou segmento de rede que o sistema externo para extrair metadados de linhagem desses sistemas e visualizar esses dados em um gráfico de linhagem.

Visão geral

Na maioria dos casos, é possível acessar muitas fontes de dados diretamente do site Cloud Pak for Data as a Service. No entanto, isso nem sempre é possível ou ideal. Em seguida, você pode usar os agentes Manta, que são instalados no mesmo local ou segmento de rede que o sistema externo do qual você deseja extrair metadados para análise de linhagem. Os casos de uso mais comuns são:

  • Não é possível conectar-se a uma fonte de dados local.
  • Você se conecta a uma fonte de dados que requer ferramentas ou bibliotecas específicas de terceiros e não pode ou não quer instalar essas ferramentas ou bibliotecas no site Cloud Pak for Data as a Service.
  • Seus data centers estão distribuídos em vários locais geográficos e você deseja evitar atrasos na transferência de dados (latência de rede).

A lista a seguir resume as etapas necessárias para importar metadados de linhagem usando os agentes Manta:

  1. Faça o download dos arquivos executáveis do agente Manta e salve-os no local de destino. Esses arquivos são compactados em um arquivo.zip. Extraia o arquivo.
  2. Registre uma nova instância de agente em Manta Data Lineage e salve o arquivo de configuração.
  3. Copie o arquivo de configuração da instância do agente para o local de destino e inicie o agente.
  4. Quando você criar uma importação de metadados, selecione o agente na lista.
Nota:

Cada instância de uma fonte de dados pode exigir uma instância de agente individual, dependendo das configurações de acesso. Por exemplo, se você tiver três instâncias de IBM Cognos Analytics, talvez seja necessário registrar três instâncias de agente e configurá-las independentemente em cada instância de Cognos Analytics. Forneça nomes significativos para que as instâncias de agente saibam a qual instância de fonte de dados o agente está conectado.

Origens de dados suportadas

Você pode usar os agentes com as seguintes fontes de dados. A tabela a seguir lista a versão mínima do agente que deve ser instalada para se conectar a cada fonte de dados.
Se você usar uma versão desatualizada de um agente que não seja mais compatível com uma fonte de dados selecionada, o trabalho de importação de metadados terá o status Em fila e os metadados dessa fonte não serão importados.

Fontes de dados e versões de agentes compatíveis
Fonte de dados suportada Versão mínima do agente
Amazon RDS for PostgreSQL 1.2.0-saas
Amazon Redshift 1.2.0-saas
Apache Hive 1.2.0-saas
Google BigQuery 1.2.0-saas
Greenplum 1.2.0-saas
IBM Cloud Databases for PostgreSQL 1.2.0-saas
IBM Cognos Analytics 1.2.0-saas
IBM DataStage para Cloud Pak for Data 1.2.0-saas
IBM Db2 1.2.0-saas
IBM Db2 for z/OS 1.2.0-saas
IBM Db2 on Cloud 1.2.0-saas
Informatica PowerCenter 1.2.0-saas
Microsoft Azure Databricks 1.2.0-saas
Microsoft Power BI (Azure) 1.2.0-saas
Microsoft Power BI Desktop 1.2.0-saas
Microsoft SQL Server Integration Services (SSIS) 1.2.0-saas
PostgreSQL 1.2.0-saas
Qlik Sense 1.2.0-saas
SAP BusinessObjects 1.2.0-saas
Tableau 1.2.0-saas
YugabyteDB 1.2.0-saas

Fontes de dados compatíveis para exportação de metadados

Você pode usar agentes para se conectar a uma fonte de dados da qual deseja exportar a linhagem de dados. O destino de exportação a seguir é compatível.

Fontes de dados compatíveis para exportação e versões do agente
Fonte de dados suportada Versão mínima do agente
Collibra 1.2.0-saas

Para obter detalhes sobre a exportação de metadados de linhagem, consulte Exportação da linhagem de dados.

Status do agente

O agente pode ter os seguintes status:

  • Online : O agente está configurado e conectado. Ele está pronto para ser usado.
  • Off-line : O agente está configurado, mas não está conectado no momento.
  • Registrado : O agente está registrado, mas precisa ser configurado no sistema externo. Para obter mais informações, consulte Configuração do agente no sistema externo.

Pré-requisitos

No sistema externo, crie uma conta de usuário do sistema operacional dedicada para executar o agente. Os arquivos executáveis do agente e o arquivo de configuração do agente são armazenados nessa conta de usuário. Use o Java Runtime Environment (JRE) versão 21 ou superior.

É importante criar uma conta de usuário dedicada no sistema externo para garantir a segurança dos dados. O arquivo de configuração do agente contém informações confidenciais que incluem um nome de usuário e uma chave de API. Esse arquivo deve estar sempre protegido. No sistema externo, somente usuários autorizados podem acessá-lo. Com uma conta de usuário dedicada para executar o agente no sistema externo, os dados confidenciais ficam seguros. Além disso, mesmo quando os dados são comprometidos, o impacto é limitado a apenas uma instância do agente.

Download dos arquivos executáveis do Manta Agent

Faça o download dos arquivos executáveis do Manta Agent no Fix Central site.

Extraia o arquivo.zip em um local onde os arquivos executáveis sejam permitidos. Por exemplo, ele pode ser /usr/local/bin/manta-agent no sistema operacional Linux e C:/manta-agent no sistema operacional Windows.

Certifique-se de instalar a versão mais recente do agente. Para obter informações sobre como atualizar a instalação atual do agente, consulte Atualização da versão do agente.

Registro de um agente em Manta Data Lineage

Para registrar um novo agente, conclua estas etapas em Manta Data Lineage :

  1. Vá para Administração > Configurações e definições > Configuração da linhagem de dados.
  2. Na guia Gerenciar agentes, clique em Novo agente.
  3. Se você já tiver o arquivo do agente Manta em seu sistema externo, vá para a próxima etapa. Caso contrário, faça o download e extraia-o no sistema externo.
  4. Defina o nome da instância do agente. Não pode conter espaços.
  5. Clique em REGISTRAR.
  6. Faça o download do arquivo de configuração. Você o usará para concluir a configuração do agente no sistema externo.
Importante: Armazene esse arquivo em um local seguro. Não é possível recuperá-lo. Se você a perder, precisará gerar novamente a chave de API para criar um novo arquivo de configuração e atualizar todos os scripts e aplicativos para usar a nova chave de API.

Nesse momento, o status do agente é Registrado.

Configuração do agente no sistema externo

Para concluir a configuração do agente no sistema externo, siga estas etapas:

  1. Copie o arquivo de configuração do agente para o mesmo local em que você extraiu os arquivos executáveis do agente.
  2. Execute o script inicial, que é run.sh ou run.bat, dependendo do seu sistema operacional. O script está na pasta bin .
Observação: Use o arquivo de configuração do agente para apenas uma instalação do agente. Se você reutilizar o mesmo arquivo de configuração para mais de uma instalação de agente, o agente mais antigo ainda será executado, não será interrompido, mas não será mais usado. Todos os trabalhos de importação de metadados são executados pelo agente que foi instalado posteriormente.

Nesse momento, o status do agente é Online. Ele está pronto para ser usado na importação de metadados. Para obter mais informações, consulte Criação de importações de metadados.

Quando o agente é executado pela primeira vez, a pasta data é criada no local em que você extraiu o arquivo.zip. A pasta data contém arquivos de registro do agente, onde é possível encontrar as atualizações de status do agente e informações sobre os trabalhos de extração em andamento.
Na pasta bin , você pode encontrar o arquivo README.md com informações úteis sobre o agente.

Atualização da versão do agente

De tempos em tempos, você deve atualizar a versão do agente para a versão mais recente. Quando a versão atual do agente está desatualizada, o agente não é iniciado e os arquivos de registro contêm uma mensagem de erro informando que é necessário instalar a versão mais recente.

Para atualizar o agente, conclua estas etapas:

  1. Faça o download da versão mais recente do agente no Fix Central site.
  2. Salve os arquivos do agente em outro destino que não seja a versão anterior do agente e extraia os novos arquivos do agente.
  3. Interrompa a versão anterior do agente executando os scripts shutdown.sh ou shutdown.bat , dependendo do seu sistema operacional.
  4. Crie uma cópia de backup do arquivo de configuração do agente anterior config.json e salve-o na pasta do novo agente. Não mova a pasta data para o novo local.
  5. Exclua toda a pasta com os arquivos do agente anterior.
  6. Inicie o novo agente executando os scripts run.sh ou run.bat , dependendo do seu sistema operacional.
  7. Vá para Dados > Linhagem de dados > Configuração da linhagem de dados > Gerenciar agentes e verifique se o status do novo agente é Online.

O agente é atualizado. Não é necessário modificar a chave da API.

Regeneração da chave de API

Em alguns casos, talvez você precise gerar novamente a chave de API de um agente. Por exemplo, quando o arquivo de configuração do agente é perdido. Nesse caso, a chave de API do ID de serviço associado deve ser gerada novamente e um novo arquivo de configuração deve ser criado.

Para gerar novamente a chave de API, conclua estas etapas:

  1. Vá para Dados > Linhagem de dados > Configuração da linhagem de dados.
  2. Na guia Gerenciar agentes, localize o agente que deseja atualizar e clique nele para exibir o painel de detalhes.
  3. Clique em Regenerate API key (Regenerar chave de API ).
  4. Faça o download do novo arquivo de configuração.
  5. No sistema externo, substitua o arquivo de configuração antigo pelo novo.
  6. Reinicie o agente usando os scripts shutdown.sh ou shutdown.bat e run.sh ou run.bat , dependendo do seu sistema operacional.

A chave de API antiga é removida automaticamente.

removendo um agente

Para remover um agente, conclua estas etapas, em qualquer ordem:

  • Na guia Manage agents (Gerenciar agentes ) em Cloud Pak for Data as a Service, localize o agente, abra o painel de detalhes e clique em Delete agent (Excluir agente ).
  • No sistema externo, interrompa o agente usando o script shutdown.sh ou shutdown.bat e exclua os arquivos que você extraiu do arquivo.zip e o arquivo de configuração do agente.

Definição das configurações do agente nos scripts setenv

Você pode definir as seguintes configurações para cada instalação de agente:

Configurações de memória
A propriedade AGENT_JVM_OPTS controla as configurações da máquina virtual Java para o agente, principalmente a alocação de memória.

Valores de exemplo:

  • Linux ou macOS sistemas operacionais: export AGENT_JVM_OPTS="-Xms1g -Xmx4g -XX:+UseG1GC"
  • Sistema operacional Windows: set "AGENT_JVM_OPTS=-Xms1g -Xmx4g -XX:+UseG1GC"

Você pode ajustar os seguintes parâmetros para a propriedade AGENT_JVM_OPTS :

  • -Xms: Esse parâmetro define o tamanho inicial do heap do Java. Por exemplo, você pode defini-lo como 1g, o que significa 1 gigabyte.
  • -Xmx: Esse parâmetro define o tamanho máximo do heap do Java. Se o agente processar fontes de dados grandes ou se ocorrerem erros de falta de memória quando o agente for executado, você poderá aumentar o valor desse parâmetro, por exemplo, para -Xmx8g ou -Xmx16g. Monitore o consumo de memória do agente para encontrar um valor ideal.
  • -XX:+UseG1GC: Esse parâmetro seleciona o coletor de lixo G1 (Garbage-First), que pode proporcionar melhor desempenho para aplicativos com tamanhos de heap maiores.

Memória do extrator do agente
A propriedade LINEAGE_AGENT_EXTRACTOR_MEMORY especifica a memória máxima (em megabytes) que a parte do extrator do agente pode usar.

Valores de exemplo:

  • Linux ou macOS sistemas operacionais: export LINEAGE_AGENT_EXTRACTOR_MEMORY=4096
  • Sistema operacional Windows: set "LINEAGE_AGENT_EXTRACTOR_MEMORY=4096"

Se o valor padrão não estiver definido, ele poderá ser derivado da memória do sistema ou de um padrão interno pré-configurado. Se o agente extrair fontes de dados grandes ou complexas e ocorrerem erros de falta de memória, você poderá aumentar o valor para 8192 para 8 GB ou 16384 para 16 GB. Quando você ajustar o valor, verifique a quantidade de memória alocada para o agente principal usando o site AGENT_JVM_OPTS e não defina um valor maior do que a memória total do sistema.

Tamanho do lote do dicionário do agente
A propriedade LINEAGE_AGENT_DICTIONARY_BATCH_SIZE especifica quantas entradas de dicionário são enviadas ao serviço central em um único lote.

Valores de exemplo:

  • Linux ou macOS sistemas operacionais: export LINEAGE_AGENT_DICTIONARY_BATCH_SIZE=1000
  • Sistema operacional Windows: set "LINEAGE_AGENT_DICTIONARY_BATCH_SIZE=1000"

O valor padrão é em torno de 500 ou 1000. Você pode aumentar o valor para 2000 ou 5000 ao preencher dicionários grandes e quando houver latência de rede entre o agente e o servidor. Se o consumo de memória for muito alto, você poderá definir um valor mais baixo do que o valor padrão.

Nível de registro
A propriedade LOGGING_LEVEL_COM_IBM_WDP_DATALINEAGE ajusta a verbosidade dos registros do agente, especificamente para componentes relacionados à linhagem.

Valores de exemplo:

  • Linux ou macOS sistemas operacionais: export LOGGING_LEVEL_COM_IBM_WDP_DATALINEAGE=DEBUG
  • Sistema operacional Windows: set "LOGGING_LEVEL_COM_IBM_WDP_DATALINEAGE=DEBUG"

Você pode definir essa propriedade com um destes valores: INFO (padrão), DEBUG, WARN, ERROR. Quando você investigar problemas ou trabalhar em problemas com o suporte IBM, defina essa propriedade como DEBUG. Na maioria dos casos, o valor padrão INFO é suficiente.

Procedimento

Para modificar essas configurações, siga estas etapas:

  1. Na pasta de instalação do agente, vá para a pasta bin e abra o script setenv para edição. Dependendo do seu sistema operacional, o script é setenv.sh ou setenv.bat.
  2. Descomente a propriedade que você deseja modificar e forneça seus valores personalizados.
  3. Salve suas alterações.
  4. Inicie o novo agente executando os scripts run.sh ou run.bat , dependendo do seu sistema operacional.

Configuração do agente para ser executado em um ambiente habilitado para FIPS

Você pode usar agentes em ambientes habilitados para FIPS. Os agentes devem ser configurados para usar os binários do IBM Semeru Runtime. Para obter mais informações, consulte a solução de criptografia FIPS 140-3 em IBM Semeru Runtimes.

Requisitos

Instale o IBM Semeru Runtime, versão 21.0.4 ou posterior.
Para obter detalhes sobre a instalação, consulte Semeru Runtimes installation.

Configuração

Para ativar o modo FIPS para um agente em um sistema externo, conclua estas etapas:

  1. Na pasta de instalação do agente, vá para a pasta bin e abra o script setenv para edição. Dependendo do seu sistema operacional, o script é setenv.sh ou setenv.bat.
  2. Adicione a variável JAVA_HOME=<path to IBM Semeru Runtimes installation> e substitua o valor <path to IBM Semeru Runtimes installation> pelo caminho para o local onde você instalou o IBM Semeru Runtimes.
  3. Na seção de propriedade AGENT_JVM_OPTS , adicione as opções -Dsemeru.fips=true -Dsemeru.customprofile=OpenJCEPlusFIPS.FIPS140-3.
  4. Inicie o agente executando os scripts run.sh ou run.bat , dependendo do seu sistema operacional.

Exemplos

Nos sistemas operacionais Linux, adicione as seguintes linhas no script setenv.sh :

export JAVA_HOME="<path to IBM Semeru Runtimes installation>"
export AGENT_JVM_OPTS="-Xms1g -Xmx4g -XX:+UseG1GC -Dsemeru.fips=true -Dsemeru.customprofile=OpenJCEPlusFIPS.FIPS140-3"

Nos sistemas operacionais Windows, adicione as seguintes linhas no script setenv.bat :

set "JAVA_HOME=<path to IBM Semeru Runtimes installation>"
set "AGENT_JVM_OPTS=-Xms1g -Xmx4g -XX:+UseG1GC -Dsemeru.fips=true -Dsemeru.customprofile=OpenJCEPlusFIPS.FIPS140-3"

Saiba Mais