Google BigQuery configuração da linhagem
Para importar metadados de linhagem de Google BigQuery, crie uma conexão, uma definição de fonte de dados e um trabalho de importação de metadados.
Google BigQuery é um data warehouse sem servidor e escalável que permite a análise de petabytes de dados.
Metadados processados
Os seguintes metadados do Google BigQuery são processados e exibidos no Lineage:
- Dicionários de dados
- Scripts
- Visualizações
- Funções
- Procedimentos armazenados
- Tabelas externas
- Vagas (apenas tipo de consulta)
Limitações
Os seguintes dados não são processados:
- Recursos que utilizam código executado dinamicamente por meio da instrução EXECUTE IMMEDIATE.
Configuração prévia
Antes de importar metadados de linhagem, certifique-se de que os seguintes pré-requisitos estejam atendidos:
- É necessário configurar uma conta de serviço do BigQuery, utilizada por aplicativos e máquinas virtuais, para cada projeto do qual os metadados são extraídos, e atribuir a ela a função IAM predefinida “ roles/bigquery.metadataViewer ”.
Esta função deve incluir as seguintes permissões:- bigquery.datasets.get
- bigquery.datasets.getIamPolicy
- bigquery.models.getMetadata
- bigquery.models.list
- bigquery.routines.get
- bigquery.routines.list
- bigquery.tables.get
- bigquery.tables.getIamPolicy
- bigquery.tables.list
- resourcemanager.projects.get
- resourcemanager.projects.list
Criação de um recurso de importação de metadados
Conexão da origem de dados
Para se conectar à fonte de dados da qual você deseja importar metadados de linhagem, é necessário selecionar uma definição de fonte de dados e uma conexão. Você pode criá-los antes de iniciar a importação de metadados ou ao criar e configurar o recurso de importação de metadados.
Definição de origem de dados
Selecione “ Google BigQuery ” como tipo de fonte de dados.
Conexão
Para importar metadados de linhagem do Google BigQuery, use uma conexão com um dos seguintes métodos de autenticação:
- Chave de conta (snippet JSON completo)
- Federação de identidade de carga de trabalho com token de acesso
- Federação de identidade de carga de trabalho com URL de token
Se você utilizar uma conexão com o método de autenticação por ID do cliente, segredo do cliente, token de acesso e token de atualização, a tarefa de importação de metadados falhará.
Para obter detalhes sobre a conexão, consulte a conexão Google BigQuery.
Modo de conexão
Você pode se conectar a Google BigQuery usando um dos seguintes modos de conexão:
- Conexão direta
- Conexão remota com um agente Manta. Quando um agente estiver configurado, selecione-o na lista. Para obter mais informações, consulte Configurando agentes para importação de metadados de linhagem.
Listas de inclusão e exclusão
É possível incluir ou excluir ativos até o nível do conjunto de dados. Forneça projetos e conjuntos de dados no formato projeto/conjunto de dados. Cada parte é avaliada como uma expressão regular. Os ativos que forem incluídos posteriormente na origem de dados também serão incluídos ou excluídos se corresponderem às condições especificadas nas listas. Valores de exemplo:
myProject/: todos os conjuntos de dados emmyProject,myProject2/.*: todos os conjuntos de dados emmyProject2,myProject3/myDataset1:myDataset1demyProject3,myProject4/myDataset[1-5]: qualquer conjunto de dados em meu sitemyProject4com um nome que comece commyDatasete termine com um dígito entre 1 e 5
Entradas externas
Se você usar scripts de trabalho ou SQL Google BigQuery externos, poderá adicioná-los em um arquivo.zip como uma entrada externa. É possível organizar a estrutura de um arquivo .zip como subpastas que representam projetos e conjuntos de dados. Depois que os scripts são verificados, eles são incluídos nos respectivos projetos e conjuntos de dados no catálogo ou projeto selecionado. O arquivo.zip pode ter a seguinte estrutura:
<project_id>
<dataset_name>
<script_name.sql>
<project_id>
<script_name.sql>
jobs
<job_name.json>
<script_name.sql>
replace.csv
connectionsConfiguration.prm
O arquivo replace.csv contém substituições de espaço reservado para os scripts que são adicionados no arquivo.zip. Para obter mais informações sobre o formato, consulte Substituições de espaço reservado.
O arquivo connectionsConfiguration.prm contém definições de recursos de conexão de banco de dados usadas em consultas federadas. O arquivo pode ter a seguinte estrutura:
[{Shortcut_Name}] Type={connection_type}
Connection_String={connection_string}
Server_Name={server_name}
Database_Name={database_name}
Schema_Name={schema_name}
User_Name={user_name}