Modo de execução ELT no DataStage
Use DataStage® no modo de execução Extrair, Carregar e Transformar (ELT) para executar consultas SQL de destino de forma mais eficiente.
- O que é o processo ELT?
- Qual é o modo de execução do ELT no DataStage?
- Disponibilidade
- Conectores suportados
- Estágios suportados
- Limitações
- Ativando o modo de execução ELT
- Selecionando uma política de materialização.
- Configurando permissões do conector do banco de dados para o modo de execução ELT
- Compilação com o comando dsjob
- Exemplo
O que é o processo ELT?
O processo primário que o DataStage usa é Extração, Transformação e Carregamento (ETL) no qual os dados são lidos na memória, processados e, em seguida, gravados em um destino. No DataStage, todos os trabalhos são executados no modo ETL por padrão.
O processo Extrair, Carregar e Transformar (ELT) transfere dados de uma origem para um banco de dados de destino e, em seguida, prepara as informações no próprio banco de dados. Em determinadas situações, é vantajoso usar o processo ELT para transformar os dados no banco de dados de destino. Um exemplo pode ser quando você precisa transformar grandes conjuntos de dados que já estão em origens ou destinos de dados específicos..
Qual é o modo de execução do ELT em DataStage?
- Nenhum modo ELT
- Quando a análise determina que o fluxo do DataStage não pode ser convertido em SQL, o modo ETL é usado e DataStage compila o fluxo com o mecanismo de tempo de execução do PX.
- Modo ELT
- Quando a análise determina que o fluxo do DataStage pode ser convertido para SQL, o modo ELT é usado, e o DataStage compila o fluxo para SQL
- Modo misto ETL e ELT
- Quando a análise determina que o fluxo do DataStage pode ser convertido apenas parcialmente para SQL, ambos os modos ETL e ELT são usados conforme necessário
Disponibilidade
O modo de execução ELT está disponível em DataStage Enterprise e DataStage Enterprise Plus.
Conectores suportados
- Amazon RDS for PostgreSQL
- Amazon Redshift
- Google BigQuery
- IBM Cloud® Databases for PostgreSQL
- IBM Db2®
- IBM Db2 para o DataStage
- IBM Db2 on Cloud
- IBM® Db2 Warehouse
- Oracle
- PostgreSQL
- Snowflake
- Teradata
- Banco de dados Teradata para o DataStage
- watsonx.data
| Conector | Modo | Limitações |
|---|---|---|
| Amazon Redshift | Mixed |
|
| Google BigQuery | elt |
|
| IBM Db2 | elt |
|
| IBM Db2 otimizado | elt |
|
| Oracle | elt |
|
Estágios suportados
| Estágio | Modo | Limitações |
|---|---|---|
| Agregador | Mixed |
|
| Copiar | elt |
|
| Filtro | Mixed |
|
| Funnel | elt |
|
| Junção | elt |
|
| Lookup | Mixed |
|
| Remove Duplicates | Mixed |
|
| Sort | Mixed |
|
| Transformador | Mixed |
|
Limitações
- Fluxos com propagação de coluna de tempo de execução ativada não são suportados.
- O truncamento de dados implícitos não é executado quando a ação da tabela é CREATE ou REPLACE
- O pushdown de origem e o pushdown completo de destino não oferecem suporte a operações entre bancos de dados ou entre esquemas.
Ativando o modo de execução ELT
- Abra um fluxo do DataStage
Na barra de ferramentas, clique no ícone de Configurações.- Clique na guia Executar ..
- Clique em Extrair, carregar, transformar (ELT). Em seguida, clique em Salvar
Selecionando uma política de materialização.
- Gerar SQL aninhado
- Apenas modelos de saída (tabelas de destino) são materializados. Cada modelo de saída é representado por uma única consulta que inclui todas as conversões de nós de entrada para saídas
- Link como tabela
- Todos os links de fluxo de integração são materializados como tabelas Essas tabelas são temporárias e são excluídas quando as tabelas de destino são construídas.
- Link como visualização
- Todos os links de fluxo de integração são materializados como visualizações Essas visualizações são temporárias e são excluídas quando as tabelas de destino são construídas.
- Avançado
- Os trocadores de cardinalidade são materializados como tabelas Um alterador de cardinalidade é um subconjunto de nós conectados, com base em estágios como Consulta, Junção e Agregador. Esses nós são combinados para conservar recursos construindo de forma mais eficiente e evitando cálculos repetitivos.
Configurando permissões do conector do banco de dados no modo de execução do ELT
- Criar visualizações a partir de instruções selecionadas
- Descartar visualizações
- Criar tabelas a partir de instruções selecionadas
- Eliminar tabelas
- Alterar tabelas para incluir restrições nulas e chaves primárias
Se um conector for configurado com instruções SQL customizadas, mais permissões serão necessárias para operações SQL que são usadas nas instruções SQL customizadas.
As permissões devem ser definidas no banco de dados correspondente por um administrador de banco de dados, o que está fora do escopo do DataStage e Cloud Pak for Data.
Compilando com o Comando dsjob
cpdctl dsjob compile --project <project name> --enable-elt-modeExemplo
- Uma origem de dados PostgreSQL
- Um estágio de Classificação
- Um estágio de Filtro
- Um destino de dados do PostgreSQL
Ative o modo ELT abrindo as configurações de execução e selecionando-o.
Depois de compilar a tarefa com êxito, o log de compilação tem uma única mensagem de "transferência completa". Essa mensagem indica que o fluxo inteiro foi compilado no modo ELT
Você executa o trabalho. Durante a execução da tarefa, os dados de origem do PostgreSQL são convertidos usando instruções SQL que aplicam a classificação e filtragem. O resultado é persistido como uma tabela definida no conector de destino PostgreSQL .
A execução da tarefa é concluída e o banco de dados de destino agora retém todos os dados transformados