Google BigQuery configuração da linhagem

Para importar metadados de linhagem de Google BigQuery, crie uma conexão, uma definição de fonte de dados e um trabalho de importação de metadados.

Google BigQuery é um data warehouse sem servidor e escalável que permite a análise de petabytes de dados.

Metadados processados

Os seguintes metadados do Google BigQuery são processados e exibidos no Lineage:

  • Dicionários de dados
  • Scripts
  • Visualizações
  • Funções
  • Procedimentos armazenados
  • Tabelas externas
  • Vagas (apenas tipo de consulta)

Limitações

Os seguintes dados não são processados:

  • Recursos que utilizam código executado dinamicamente por meio da instrução EXECUTE IMMEDIATE.

Configuração prévia

Antes de importar metadados de linhagem, certifique-se de que os seguintes pré-requisitos estejam atendidos:

  • É necessário configurar uma conta de serviço do BigQuery, utilizada por aplicativos e máquinas virtuais, para cada projeto do qual os metadados são extraídos, e atribuir a ela a função IAM predefinida “ roles/bigquery.metadataViewer ”.
    Esta função deve incluir as seguintes permissões:
    • bigquery.datasets.get
    • bigquery.datasets.getIamPolicy
    • bigquery.models.getMetadata
    • bigquery.models.list
    • bigquery.routines.get
    • bigquery.routines.list
    • bigquery.tables.get
    • bigquery.tables.getIamPolicy
    • bigquery.tables.list
    • resourcemanager.projects.get
    • resourcemanager.projects.list

Criação de um recurso de importação de metadados

Conexão da origem de dados

Para se conectar à fonte de dados da qual você deseja importar metadados de linhagem, é necessário selecionar uma definição de fonte de dados e uma conexão. Você pode criá-los antes de iniciar a importação de metadados ou ao criar e configurar o recurso de importação de metadados.

Definição de origem de dados

Selecione “ Google BigQuery ” como tipo de fonte de dados.

Conexão

Para importar metadados de linhagem do Google BigQuery, use uma conexão com um dos seguintes métodos de autenticação:

  • Chave de conta (snippet JSON completo)
  • Federação de identidade de carga de trabalho com token de acesso
  • Federação de identidade de carga de trabalho com URL de token

Se você utilizar uma conexão com o método de autenticação por ID do cliente, segredo do cliente, token de acesso e token de atualização, a tarefa de importação de metadados falhará.

Para obter detalhes sobre a conexão, consulte a conexão Google BigQuery.

Modo de conexão

Você pode se conectar a Google BigQuery usando um dos seguintes modos de conexão:

Listas de inclusão e exclusão

É possível incluir ou excluir ativos até o nível do conjunto de dados. Forneça projetos e conjuntos de dados no formato projeto/conjunto de dados. Cada parte é avaliada como uma expressão regular. Os ativos que forem incluídos posteriormente na origem de dados também serão incluídos ou excluídos se corresponderem às condições especificadas nas listas. Valores de exemplo:

  • myProject/: todos os conjuntos de dados em myProject,
  • myProject2/.*: todos os conjuntos de dados em myProject2,
  • myProject3/myDataset1: myDataset1 de myProject3,
  • myProject4/myDataset[1-5]: qualquer conjunto de dados em meu site myProject4 com um nome que comece com myDataset e termine com um dígito entre 1 e 5

Entradas externas

Se você usar scripts de trabalho ou SQL Google BigQuery externos, poderá adicioná-los em um arquivo.zip como uma entrada externa. É possível organizar a estrutura de um arquivo .zip como subpastas que representam projetos e conjuntos de dados. Depois que os scripts são verificados, eles são incluídos nos respectivos projetos e conjuntos de dados no catálogo ou projeto selecionado. O arquivo.zip pode ter a seguinte estrutura:

<project_id>
   <dataset_name>
      <script_name.sql>
<project_id>
        <script_name.sql>
jobs
       <job_name.json>
<script_name.sql>
replace.csv
connectionsConfiguration.prm

O arquivo replace.csv contém substituições de espaço reservado para os scripts que são adicionados no arquivo.zip. Para obter mais informações sobre o formato, consulte Substituições de espaço reservado.

O arquivo connectionsConfiguration.prm contém definições de recursos de conexão de banco de dados usadas em consultas federadas. O arquivo pode ter a seguinte estrutura:

[{Shortcut_Name}] Type={connection_type}
Connection_String={connection_string}
Server_Name={server_name}
Database_Name={database_name}
Schema_Name={schema_name}
User_Name={user_name}

Saiba Mais