Apache Hive configuração de linhagem
Para importar metadados de linhagem do Apache Hive, crie uma conexão, uma definição de fonte de dados e uma tarefa de importação de metadados.
Apache Hive é um projeto de software de data warehouse que fornece consulta e análise de dados e é construído sobre Apache Hadoop.
Versões compatíveis do Apache Hive
- Apache Hive 2.3 ou posterior
Metadados processados
Os seguintes metadados do Apache Hive são processados e exibidos no Lineage:
- Hive Metastore
- Tabelas
- Visualizações
- HiveQL scripts
Limitações
As limitações a seguir se aplicam:
- Não é possível importar o Lineage nas instâncias que operam em um ambiente compatível com FIPS, pois os drivers do JDBC não são compatíveis com FIPS.
- Os recursos que utilizam código executado dinamicamente por meio da instrução EXECUTE IMMEDIATE não são processados.
Configuração prévia
Antes de importar metadados de linhagem, certifique-se de que os seguintes pré-requisitos estejam atendidos:
- É necessário ter
SELECTprivilégios deGRANT OPTIONem todas as tabelas dos bancos de dados Hive para permitir a execução deSHOW CREATE TABLEdurante a extração de metadados. - Você deve ter permissão para executar estas instruções:
SHOW DATABASES,SHOW CREATE TABLE,SHOW TABLES IN,SHOW FUNCTIONS LIKE, eSHOW VIEWS IN.
Criação de um recurso de importação de metadados
Conexão da origem de dados
Para se conectar à fonte de dados da qual você deseja importar metadados de linhagem, é necessário selecionar uma definição de fonte de dados e uma conexão. Você pode criá-los antes de iniciar a importação de metadados ou ao criar e configurar o recurso de importação de metadados.
Definição de origem de dados
Selecione “ Apache Hive ” como tipo de fonte de dados.
Conexão
Para obter detalhes sobre a conexão, consulte a conexão Apache Hive.
Modo de conexão
Você pode se conectar ao Apache Hive utilizando um dos seguintes modos de conexão:
- Conexão direta
- Conexão remota com um agente Manta. Quando um agente estiver configurado, selecione-o na lista. Para obter mais informações, consulte “Configurando agentes para a importação de metadados de linhagem ”.
Listas de inclusão e exclusão
É possível incluir ou excluir bancos de dados. Forneça bancos de dados por seus nomes separados por vírgulas. Cada parte é avaliada como uma expressão regular. Os ativos que forem incluídos posteriormente na origem de dados também serão incluídos ou excluídos se corresponderem às condições especificadas nas listas. Valores de exemplo:
myDB/: todos os ativos emmyDB,myDB2/.*: todos os ativos emmyDB2.
Entradas externas
Você pode adicionar scripts QL externos Apache Hive que funcionam com o banco de dados configurado em um arquivo.zip como entradas externas. É possível organizar a estrutura de um arquivo .zip como subpastas que representam bancos de dados. Depois que os scripts são verificados, eles são incluídos aos respectivos bancos de dados no catálogo ou projeto selecionado. O arquivo.zip pode ter a seguinte estrutura:
<database_name>
<script_name.sql>
<script_name.sql>
replace.csv
linkedServerConnectionsConfiguration.prm
O replace.csv arquivo contém substituições de espaços reservados para os scripts que são adicionados ao arquivo.zip. Para obter mais informações sobre o formato, consulte Substituições de espaços reservados.
O linkedServerConnectionsConfiguration.prm arquivo contém definições de conexão de servidor vinculado.