Apache Hive configuração de linhagem

Para importar metadados de linhagem do Apache Hive, crie uma conexão, uma definição de fonte de dados e uma tarefa de importação de metadados.

Apache Hive é um projeto de software de data warehouse que fornece consulta e análise de dados e é construído sobre Apache Hadoop.

Versões compatíveis do Apache Hive

  • Apache Hive 2.3 ou posterior

Metadados processados

Os seguintes metadados do Apache Hive são processados e exibidos no Lineage:

  • Hive Metastore
  • Tabelas
  • Visualizações
  • HiveQL scripts

Limitações

As limitações a seguir se aplicam:

  • Não é possível importar o Lineage nas instâncias que operam em um ambiente compatível com FIPS, pois os drivers do JDBC não são compatíveis com FIPS.
  • Os recursos que utilizam código executado dinamicamente por meio da instrução EXECUTE IMMEDIATE não são processados.

Configuração prévia

Antes de importar metadados de linhagem, certifique-se de que os seguintes pré-requisitos estejam atendidos:

  • É necessário ter SELECT privilégios de GRANT OPTION em todas as tabelas dos bancos de dados Hive para permitir a execução de SHOW CREATE TABLE durante a extração de metadados.
  • Você deve ter permissão para executar estas instruções: SHOW DATABASES, SHOW CREATE TABLE, SHOW TABLES IN, SHOW FUNCTIONS LIKE, e SHOW VIEWS IN.

Criação de um recurso de importação de metadados

Conexão da origem de dados

Para se conectar à fonte de dados da qual você deseja importar metadados de linhagem, é necessário selecionar uma definição de fonte de dados e uma conexão. Você pode criá-los antes de iniciar a importação de metadados ou ao criar e configurar o recurso de importação de metadados.

Definição de origem de dados

Selecione “ Apache Hive ” como tipo de fonte de dados.

Conexão

Para obter detalhes sobre a conexão, consulte a conexão Apache Hive.

Modo de conexão

Você pode se conectar ao Apache Hive utilizando um dos seguintes modos de conexão:

Listas de inclusão e exclusão

É possível incluir ou excluir bancos de dados. Forneça bancos de dados por seus nomes separados por vírgulas. Cada parte é avaliada como uma expressão regular. Os ativos que forem incluídos posteriormente na origem de dados também serão incluídos ou excluídos se corresponderem às condições especificadas nas listas. Valores de exemplo:

  • myDB/: todos os ativos em myDB,
  • myDB2/.*: todos os ativos em myDB2.

Entradas externas

Você pode adicionar scripts QL externos Apache Hive que funcionam com o banco de dados configurado em um arquivo.zip como entradas externas. É possível organizar a estrutura de um arquivo .zip como subpastas que representam bancos de dados. Depois que os scripts são verificados, eles são incluídos aos respectivos bancos de dados no catálogo ou projeto selecionado. O arquivo.zip pode ter a seguinte estrutura:

<database_name>
   <script_name.sql>
<script_name.sql>
replace.csv
linkedServerConnectionsConfiguration.prm

O replace.csv arquivo contém substituições de espaços reservados para os scripts que são adicionados ao arquivo.zip. Para obter mais informações sobre o formato, consulte Substituições de espaços reservados.

O linkedServerConnectionsConfiguration.prm arquivo contém definições de conexão de servidor vinculado.

Opções de importação avançadas

Saiba Mais