IBM InfoSphere DataStage configuração de linhagem
Para importar metadados de linhagem do IBM InfoSphere DataStage, crie uma conexão, uma definição de fonte de dados e uma tarefa de importação de metadados.
O IBM InfoSphere DataStage é uma plataforma de integração de dados que ajuda a projetar, desenvolver e executar tarefas que movem e transformam dados.
Metadados processados
As etapas a seguir são processadas e exibidas no Lineage.
- Etapa de processamento
- Agregador
- Filtro BLOOM
- Aplicação de mudança
- Captura de mudança
- Soma de verificação
- Comparar
- Compactar
- Copiar
- Mascaramento de Dados
- Decodificação
- Diferença
- Codificação
- Expandir
- Filtro externo com restrições: é aplicada uma conexão adequada entre as colunas de entrada e saída.
- Filtro
- FTP Corporativo
- Plugin FTP
- Funil
- Genérico com restrições: é aplicada uma conexão adequada entre as colunas de entrada e saída.
- Head
- Junção
- Consulta
- Mesclar
- Modificar
- Peek
- Tabela Dinâmica
- Pivot Enterprise
- Remove Duplicates
- Row Generator
- Dimensão de modificação lenta
- Classificar
- Surrogate Key Generator
- Comutador
- Transformador com restrição: as rotinas e funções do ` DataStage ` nas expressões são resolvidas como fluxos diretos.
- Wave Generator
- Estágio Quality
- Regra de Dados
- estágio File
- Amazon S3
- Azure Storage
- Cloud Object Storage
- Arquivo simples complexo
- Conjunto de dados
- External Source
- External Target
- Conector de Arquivos
- Conjunto de arquivos
- Lookup File Set
- Sequential File
- Dado não Estruturado
- zOS File
- Estágio Container
- Contêiner Local
- Contêiner Compartilhado
- Etapa do banco de dados
- Federação clássica com restrição: o fluxo termina em DataStage.
- Cognos TM1 com restrição: O fluxo termina em DataStage.
- Db2
- Distributed Transaction
- DRS
- Greenplum
- HBase com restrição: O fluxo termina em DataStage.
- Hive
- Informix Carregamento em massa com restrição: o fluxo termina em DataStage.
- Informix CLI com restrição: O fluxo termina em DataStage.
- Informix Empresa com restrição: O fluxo termina em DataStage.
- iWay com restrição: O fluxo termina em DataStage.
- JDBC
- MS SQL
- Netezza
- ODBC
- Oracle
- PostgreSQL
- Procedimento armazenado com restrição: os procedimentos armazenados para Sybase e Teradata não são processados.
- Sybase Carga a granel
- Sybase Enterprise
- Sybase OC
- Teradata
as seguintes macros de status de tarefa são processadas:
- DSHostName
- DSJobName
- DSProjectName
os parâmetros dos contêineres compartilhados são processados e exibidos no Lineage.
- Conexão da coluna Wise
- Por padrão, as colunas são conectadas entre os conjuntos de dados de entrada e saída com base na correspondência de nomes. Quando uma coluna de entrada e uma coluna de saída têm o mesmo nome, elas são vinculadas diretamente em uma relação um-para-um. Se uma coluna de entrada não tiver uma coluna de saída correspondente, ela será conectada a todas as colunas de saída, exceto aquelas que já tenham uma correspondência com o mesmo nome. As colunas de saída sem uma coluna de entrada correspondente se comportam da mesma maneira, conectando-se a todas as colunas de entrada, exceto aquelas cujo nome coincida diretamente.
Criação de um recurso de importação de metadados
Conexão da origem de dados
É possível importar metadados de linhagem do site IBM InfoSphere DataStage apenas por meio de arquivos externos. Você não se conecta diretamente a IBM InfoSphere DataStage. Isso significa que você precisa fornecer apenas uma definição de fonte de dados. Você pode criá-lo antes de começar a criar um ativo de importação de metadados ou pode fazê-lo diretamente no assistente de importação de metadados.
Depois de selecionar uma definição de fonte de dados, a conexão é criada automaticamente. Em seguida, você pode prosseguir com a adição de entradas externas, que são obrigatórias.
Definição de origem de dados
Selecione IBM InfoSphere DataStage como o tipo de fonte de dados.
É possível executar várias importações de metadados para a mesma definição de fonte de dados. A linha de descendência gerada por uma importação de metadados não é sobrescrita quando é executada uma importação de metadados diferente para a mesma definição de fonte de dados. Em vez disso, a linhagem de todas as importações de metadados é combinada. Quando a mesma importação de metadados é executada novamente, sua linhagem gerada anteriormente é atualizada com os resultados da última execução. Com isso, é possível importar a linhagem em lotes menores, como para projetos individuais, por meio de importações separadas de metadados. Vários usuários podem importar a linhagem de diferentes partes da mesma fonte de dados de forma independente, e a linhagem proveniente dessas importações é combinada em uma única visualização de linhagem.
Entradas externas
Você pode fornecer recursos d InfoSphere DataStage, como tarefas, etapas ou arquivos de metadados operacionais, como entradas externas em um arquivo.zip. A pasta deve ter a seguinte estrutura:
<job_name.xml>- Os trabalhos do DataStage em paralelo que você deseja analisar e os conjuntos de parâmetros utilizados nesses trabalhos, reunidos em um único arquivo XML, exportado a partir do cliente do designer.omd_files- Uma pasta para arquivos de metadados operacionais (OMD).<omd_file_name>- Arquivos de metadados operacionais coletados durante a execução de tarefas para resolver qualquer tipo de parâmetro nas tarefas.
sql_files- Uma pasta que contém todos os arquivos SQL.<sql_file_name>- Um arquivo com consultas SQL.
DSParams- Um arquivo que contém os parâmetros no nível do projeto ou do ambiente, se for o caso. Você pode obter esse arquivo no diretório do projeto.datastageParameterOverride.txt- Um arquivo com substituições de conjuntos de parâmetros, caso seus trabalhos utilizem conjuntos de parâmetros.connection_definition/odbcConnectionDefinition.ini- Um arquivo com definições de conexão para conexões do tipo “ ODBC ”. As definições das conexões do ` ODBC ` não estão incluídas nas exportações XML do ` DataStage ` e devem ser especificadas separadamente.datastageComponentOverrides.csv- Um arquivo com substituições de linhagem de componentes.
O formato do datastageParameterOverride.txt arquivo. O datastageParameterOverride.txt arquivo contém o seguinte conteúdo:
[ENVIRONMENT]
PARAM1_NAME = "param1_value"
PARAM2_NAME = "param2_value"
PARAM3_NAME = "param3_value"
[PARAMETER_SET/parameter_set_name]
param4_name = "default_param4_value"
param5_name = "default_param5_value"
$PARAM3_NAME = "$PROJDEF"
[VALUE_FILE/parameter_set_name/value_file1_name]
param4_name = "some_param4_value"
param5_name = "some_param5_value"
$PARAM3_NAME = "some_param3_value"
[VALUE_FILE/parameter_set_name/value_file2_name]
param4_name = "other_param4_value"
param5_name = "other_param5_value"
$PARAM3_NAME = "other_param3_value"
[JOB/job1_name]
param6_name = "param6_value"
param7_name = "param7_value"
[JOB/job2_name]
param7_name = "param8_value"
O formato do connection_definition/odbcConnectionDefinition.ini arquivo. O connection_definition/odbcConnectionDefinition.ini arquivo contém o seguinte conteúdo. Crie uma seção separada [Shortcut_Name] para cada conexão.
[<Shortcut_Name>]
Type=<connection_type>
Connection_String=<connection_string>
Server_Name=<server_name>
Database_Name=<database_name>
Schema_Name=<schema_name>
User_Name=<user_name>
- Nome do atalho : O nome da conexão ou do servidor de dados utilizado pela ferramenta de integração de dados.
- connection_type : O tipo de fonte de dados.
- connection_string : Uma string de conexão do tipo “ JDBC ” ou qualquer identificação do banco de dados, como o ID do sistema (SID) ou o nome do host.
- server_name : O valor depende do tipo de fonte de dados:
- Db2, Microsoft SQL Server, Netezza Performance Server, SAP ASE (anteriormente Sybase ) ou Teradata : o nome do servidor.
- FTP: O nome do servidor.
- Oracle e outros bancos de dados: o valor é ignorado.
- nome_do_banco_de_dados : O valor depende do tipo de fonte de dados:
- Oracle : O nome do banco de dados global.
- Db2, Microsoft SQL Server, Netezza Performance Server, SAP ASE (anteriormente Sybase ), Teradata e outros bancos de dados: o nome do banco de dados padrão.
- user_name : O nome do usuário que faz login no banco de dados.
Adicione uma nova linha ao final dos parâmetros de cada seção.
O formato do datastageComponentOverrides.csv arquivo. O datastageComponentOverrides.csv arquivo contém o seguinte conteúdo:
"Full path to Stage";"Input Link name";"Input Column name";"Output Link name";"Output Column name";"Edge Type (DIRECT | FILTER)";"Description (optional)"
"manual_mapping_job/Generic_3";"DSLink2";"a";"DSLink5";"b";"DIRECT";""
O caminho até o palco está no formato Job/[Shared and Local containers optional]/Stage.
Opções de importação avançadas
- Perfil de desempenho
- Para determinadas fontes de dados, é possível selecionar um perfil de desempenho. Dependendo das suas necessidades atuais, a importação de metadados de linhagem pode ser mais rápida ou mais completa. Você pode escolher entre os seguintes perfis:
- Rápido : O baixo consumo de tempo e memória são as prioridades neste perfil. Se a sua entrada for muito grande, a linhagem pode não estar completa.
- Equilibrado : Tanto o desempenho quanto a integridade da linhagem são importantes. Trata-se de um equilíbrio entre a integridade da linhagem e o tempo e a memória dedicados à importação da linhagem.
- Completude : A completude da linhagem é a prioridade neste perfil. Se o seu conjunto de dados for grande, a importação da linhagem pode consumir uma quantidade significativa de recursos e tempo.
- Perfil personalizado : Você pode criar seu próprio perfil de desempenho definindo valores para as seguintes propriedades:
- Limite de tempo de espera da análise de fluxo de dados : Especifica o tempo máximo estimado (em segundos) após o qual a análise de fluxo de dados de uma única entrada é interrompida. O horário é verificado quando cada nó for incluído ou, em alguns casos, quando as bordas forem criadas. Portanto, em alguns casos, o tempo limite pode exceder ligeiramente o limite especificado. Se você definir o valor como 0, a análise não será interrompida. Valor de exemplo:
60. - Limite de arestas na análise de fluxo de dados : Especifica o número máximo de arestas permitidas para uma única entrada durante a análise de fluxo de dados. Se esse limite for excedido, todas as bordas de filtro serão removidas e nenhuma outra borda de filtro será incluída. Se o limite ainda for excedido mesmo depois disso, a análise será interrompida e a entrada falhará. Para desativar o limite, configure o valor como "0" (zero). Valor de exemplo:
2500.
- Limite de tempo de espera da análise de fluxo de dados : Especifica o tempo máximo estimado (em segundos) após o qual a análise de fluxo de dados de uma única entrada é interrompida. O horário é verificado quando cada nó for incluído ou, em alguns casos, quando as bordas forem criadas. Portanto, em alguns casos, o tempo limite pode exceder ligeiramente o limite especificado. Se você definir o valor como 0, a análise não será interrompida. Valor de exemplo:
- Autenticação de usuário proxy do Oracle
- Você pode utilizar a autenticação de usuário por proxy do tipo “ Oracle ”. Defina o valor como
truepara alterar os nomes de usuário do Oracle do\"USERNAME[SCHEMA_OWNER]\"formato para\"SCHEMA_OWNER\"o formato. Em outros casos, defina o valor comofalse. - Arquivos de valor
- Especifique os nomes dos arquivos de valores a serem usados nos Conjuntos de Parâmetros, por ordem de prioridade. Por exemplo,
DEV1,TEST,PROD.