Configuração da linhagem do Microsoft Azure Databricks
Para importar metadados de linhagem do Microsoft Azure Databricks, crie uma conexão, uma definição de fonte de dados e uma tarefa de importação de metadados.
O Microsoft Azure Databricks é uma ferramenta de análise de big data baseada no Apache Spark.
Metadados processados
Os seguintes metadados do Microsoft Azure Databricks são processados e exibidos no Lineage:
- Catálogos
- Esquemas
- tabelas e visualizações
- Funções
- Blocos de notas
Limitações
As limitações a seguir se aplicam:
- Os comandos do Notebook Scala não são processados. Dependendo do caso de uso, você pode utilizar o formato OpenLineage como alternativa.
- Os comandos do Notebook R não são processados.
- As bibliotecas personalizadas não são processadas.
- As definições de funções e visualizações do Metastore d Hive não são processadas.
Configuração prévia
Antes de importar metadados de linhagem, certifique-se de que os seguintes pré-requisitos estejam atendidos:
- Você tem acesso à rede da instância do IBM Automatic Data Lineage à API do Databricks hospedada pela Databricks.
- Você forneceu um token de acesso pessoal (PAT) do Databricks para autenticar o scanner Manta Databricks. Você pode obter o token de acesso pessoal pela interface do usuário do Databricks. O token é usado para autenticar o Automatic Data Lineage na instância do Databricks escaneada.
- Você possui um token de acesso pessoal associado a uma conta de administrador do metastore, o que permite extrair todos os ativos sem restrições.
- Você possui uma função de administrador do Metastore ou tem os seguintes privilégios para extrair tipos de ativos específicos:
- Catálogos
- Você é o proprietário do catálogo ou possui a
USE_CATALOGpermissão necessária.
- Você é o proprietário do catálogo ou possui a
- Schemas
- Você é o proprietário do esquema ou possui o
USE_SCHEMAprivilégio. - Você é o proprietário do catálogo pai ou possui os
USE_CATALOGprivilégios necessários para acessá-lo.
- Você é o proprietário do esquema ou possui o
- tabelas e visualizações
- Você é o proprietário da tabela ou da visualização ou possui o
SELECTprivilégio. - Você é o proprietário do catálogo pai ou possui o
USE_CATALOGprivilégio. - Você é o proprietário do esquema pai ou possui o
USE_SCHEMAprivilégio.
- Você é o proprietário da tabela ou da visualização ou possui o
- Functions
- Você é o proprietário da função ou possui o
EXECUTEprivilégio. - Você é o proprietário do catálogo pai ou possui o
USE_CATALOGprivilégio. - Você é o proprietário do esquema pai ou possui o
USE_SCHEMAprivilégio.
- Você é o proprietário da função ou possui o
- Blocos de notas
- Você é o proprietário do notebook ou, pelo menos
READ, tem acesso a ele.
- Você é o proprietário do notebook ou, pelo menos
- Catálogos
- Você tem privilégios
SELECTem todos os recursos do metastore do Hive. Por exemplo, esquemas e tabelas para garantir uma extração completa. Hive Os recursos do Metastore também são acessados por meio do token de acesso pessoal.
Criação de um recurso de importação de metadados
Conexão da origem de dados
Para se conectar à fonte de dados da qual você deseja importar metadados de linhagem, é necessário selecionar uma definição de fonte de dados e uma conexão. Você pode criá-los antes de iniciar a importação de metadados ou ao criar e configurar o recurso de importação de metadados.
Definição de origem de dados
Selecione “ Azure Databricks ” da Microsoft como tipo de fonte de dados.
Conexão
Para obter detalhes sobre a conexão, consulte Conexão com o Microsoft Azure Databricks.
Modo de conexão
Você pode se conectar ao Microsoft Azure Databricks usando um dos seguintes modos de conexão:
- Conexão direta
- Conexão remota com um agente Manta. Quando um agente estiver configurado, selecione-o na lista. Para obter mais informações, consulte Configuração de agentes para importação de metadados de linhagem.
Listas de inclusão e exclusão
É possível incluir ou excluir ativos até o nível do esquema. Forneça catálogos e esquemas no formato catálogo/esquema. Cada parte é avaliada como uma expressão regular. Os ativos que forem incluídos posteriormente na origem de dados também serão incluídos ou excluídos se corresponderem às condições especificadas nas listas. Valores de exemplo:
myCatalog/: todos os esquemas emmyCatalog,myCatalog/.*: todos os esquemas emmyCatalog,myCatalog3/mySchema1:mySchema1demyCatalog3,myCatalog4/mySchema[1-5]: qualquer esquema em meu sitemyCatalog4com um nome que comece commySchemae termine com um dígito entre 1 e 5
Entradas externas
Se você usar arquivos DLL externos do Microsoft Azure Databricks, poderá adicioná-los em um arquivo.zip como entrada externa. Você pode organizar a estrutura do arquivo.zip como a pasta dll com subpastas ou arquivos que representam a estrutura do espaço de trabalho. O arquivo.zip pode ter a seguinte estrutura:
<dll>
<catalog_name_folder>
<schema_name_folder>
<tables>
<table_name.sql>
<views>
<view_name.sql>
Opções de importação avançadas
- Exibir linhagem da tabela
- As bordas geradas entre tabelas para as quais as informações de linhagem em nível de coluna não foram localizadas.
- Usar a API de rastreamento de linhagem
- Determine como os dados de linhagem de tabelas e colunas são recuperados do Databricks. Quando configurada como
true, é utilizada a API de Rastreamento de Linhagem, o que pode afetar o desempenho ao analisar grandes volumes de dados. Quando configurada comofalse, a API de instruções SQL é utilizada em seu lugar (por exemplo,system.access.table_lineage and related tables).