Configuração da linhagem do Microsoft Azure Databricks

Para importar metadados de linhagem do Microsoft Azure Databricks, crie uma conexão, uma definição de fonte de dados e uma tarefa de importação de metadados.

O Microsoft Azure Databricks é uma ferramenta de análise de big data baseada no Apache Spark.

Metadados processados

Os seguintes metadados do Microsoft Azure Databricks são processados e exibidos no Lineage:

  • Catálogos
  • Esquemas
  • tabelas e visualizações
  • Funções
  • Blocos de notas

Limitações

As limitações a seguir se aplicam:

  • Os comandos do Notebook Scala não são processados. Dependendo do caso de uso, você pode utilizar o formato OpenLineage como alternativa.
  • Os comandos do Notebook R não são processados.
  • As bibliotecas personalizadas não são processadas.
  • As definições de funções e visualizações do Metastore d Hive não são processadas.

Configuração prévia

Antes de importar metadados de linhagem, certifique-se de que os seguintes pré-requisitos estejam atendidos:

  • Você tem acesso à rede da instância do IBM Automatic Data Lineage à API do Databricks hospedada pela Databricks.
  • Você forneceu um token de acesso pessoal (PAT) do Databricks para autenticar o scanner Manta Databricks. Você pode obter o token de acesso pessoal pela interface do usuário do Databricks. O token é usado para autenticar o Automatic Data Lineage na instância do Databricks escaneada.
  • Você possui um token de acesso pessoal associado a uma conta de administrador do metastore, o que permite extrair todos os ativos sem restrições.
  • Você possui uma função de administrador do Metastore ou tem os seguintes privilégios para extrair tipos de ativos específicos:
    • Catálogos
      • Você é o proprietário do catálogo ou possui a USE_CATALOG permissão necessária.
    • Schemas
      • Você é o proprietário do esquema ou possui o USE_SCHEMA privilégio.
      • Você é o proprietário do catálogo pai ou possui os USE_CATALOG privilégios necessários para acessá-lo.
    • tabelas e visualizações
      • Você é o proprietário da tabela ou da visualização ou possui o SELECT privilégio.
      • Você é o proprietário do catálogo pai ou possui o USE_CATALOG privilégio.
      • Você é o proprietário do esquema pai ou possui o USE_SCHEMA privilégio.
    • Functions
      • Você é o proprietário da função ou possui o EXECUTE privilégio.
      • Você é o proprietário do catálogo pai ou possui o USE_CATALOG privilégio.
      • Você é o proprietário do esquema pai ou possui o USE_SCHEMA privilégio.
    • Blocos de notas
      • Você é o proprietário do notebook ou, pelo menos READ , tem acesso a ele.
  • Você tem privilégios SELECT em todos os recursos do metastore do Hive. Por exemplo, esquemas e tabelas para garantir uma extração completa. Hive Os recursos do Metastore também são acessados por meio do token de acesso pessoal.

Criação de um recurso de importação de metadados

Conexão da origem de dados

Para se conectar à fonte de dados da qual você deseja importar metadados de linhagem, é necessário selecionar uma definição de fonte de dados e uma conexão. Você pode criá-los antes de iniciar a importação de metadados ou ao criar e configurar o recurso de importação de metadados.

Definição de origem de dados

Selecione “ Azure Databricks ” da Microsoft como tipo de fonte de dados.

Conexão

Para obter detalhes sobre a conexão, consulte Conexão com o Microsoft Azure Databricks.

Modo de conexão

Você pode se conectar ao Microsoft Azure Databricks usando um dos seguintes modos de conexão:

Listas de inclusão e exclusão

É possível incluir ou excluir ativos até o nível do esquema. Forneça catálogos e esquemas no formato catálogo/esquema. Cada parte é avaliada como uma expressão regular. Os ativos que forem incluídos posteriormente na origem de dados também serão incluídos ou excluídos se corresponderem às condições especificadas nas listas. Valores de exemplo:

  • myCatalog/: todos os esquemas em myCatalog,
  • myCatalog/.*: todos os esquemas em myCatalog,
  • myCatalog3/mySchema1: mySchema1 de myCatalog3,
  • myCatalog4/mySchema[1-5]: qualquer esquema em meu site myCatalog4 com um nome que comece com mySchema e termine com um dígito entre 1 e 5

Entradas externas

Se você usar arquivos DLL externos do Microsoft Azure Databricks, poderá adicioná-los em um arquivo.zip como entrada externa. Você pode organizar a estrutura do arquivo.zip como a pasta dll com subpastas ou arquivos que representam a estrutura do espaço de trabalho. O arquivo.zip pode ter a seguinte estrutura:

<dll>
    <catalog_name_folder>
      <schema_name_folder>
        <tables>
          <table_name.sql>
        <views>
          <view_name.sql>

Opções de importação avançadas

Exibir linhagem da tabela
As bordas geradas entre tabelas para as quais as informações de linhagem em nível de coluna não foram localizadas.
Usar a API de rastreamento de linhagem
Determine como os dados de linhagem de tabelas e colunas são recuperados do Databricks. Quando configurada como true, é utilizada a API de Rastreamento de Linhagem, o que pode afetar o desempenho ao analisar grandes volumes de dados. Quando configurada como false, a API de instruções SQL é utilizada em seu lugar (por exemplo, system.access.table_lineage and related tables).

Saiba Mais