IBM InfoSphere DataStage configuração de linhagem

Para importar metadados de linhagem do IBM InfoSphere DataStage, crie uma conexão, uma definição de fonte de dados e uma tarefa de importação de metadados.

O IBM InfoSphere DataStage é uma plataforma de integração de dados que ajuda a projetar, desenvolver e executar tarefas que movem e transformam dados.

Metadados processados

As etapas a seguir são processadas e exibidas no Lineage.

  • Etapa de processamento
    • Agregador
    • Filtro BLOOM
    • Aplicação de mudança
    • Captura de mudança
    • Soma de verificação
    • Comparar
    • Compactar
    • Copiar
    • Mascaramento de Dados
    • Decodificação
    • Diferença
    • Codificação
    • Expandir
    • Filtro externo com restrições: é aplicada uma conexão adequada entre as colunas de entrada e saída.
    • Filtro
    • FTP Corporativo
    • Plugin FTP
    • Funil
    • Genérico com restrições: é aplicada uma conexão adequada entre as colunas de entrada e saída.
    • Head
    • Junção
    • Consulta
    • Mesclar
    • Modificar
    • Peek
    • Tabela Dinâmica
    • Pivot Enterprise
    • Remove Duplicates
    • Row Generator
    • Dimensão de modificação lenta
    • Classificar
    • Surrogate Key Generator
    • Comutador
    • Transformador com restrição: as rotinas e funções do ` DataStage ` nas expressões são resolvidas como fluxos diretos.
    • Wave Generator
  • Estágio Quality
    • Regra de Dados
  • estágio File
    • Amazon S3
    • Azure Storage
    • Cloud Object Storage
    • Arquivo simples complexo
    • Conjunto de dados
    • External Source
    • External Target
    • Conector de Arquivos
    • Conjunto de arquivos
    • Lookup File Set
    • Sequential File
    • Dado não Estruturado
    • zOS File
  • Estágio Container
    • Contêiner Local
    • Contêiner Compartilhado
  • Etapa do banco de dados
    • Federação clássica com restrição: o fluxo termina em DataStage.
    • Cognos TM1 com restrição: O fluxo termina em DataStage.
    • Db2
    • Distributed Transaction
    • DRS
    • Greenplum
    • HBase com restrição: O fluxo termina em DataStage.
    • Hive
    • Informix Carregamento em massa com restrição: o fluxo termina em DataStage.
    • Informix CLI com restrição: O fluxo termina em DataStage.
    • Informix Empresa com restrição: O fluxo termina em DataStage.
    • iWay com restrição: O fluxo termina em DataStage.
    • JDBC
    • MS SQL
    • Netezza
    • ODBC
    • Oracle
    • PostgreSQL
    • Procedimento armazenado com restrição: os procedimentos armazenados para Sybase e Teradata não são processados.
    • Sybase Carga a granel
    • Sybase Enterprise
    • Sybase OC
    • Teradata

as seguintes macros de status de tarefa são processadas:

  • DSHostName
  • DSJobName
  • DSProjectName

os parâmetros dos contêineres compartilhados são processados e exibidos no Lineage.

Conexão da coluna Wise
Por padrão, as colunas são conectadas entre os conjuntos de dados de entrada e saída com base na correspondência de nomes. Quando uma coluna de entrada e uma coluna de saída têm o mesmo nome, elas são vinculadas diretamente em uma relação um-para-um. Se uma coluna de entrada não tiver uma coluna de saída correspondente, ela será conectada a todas as colunas de saída, exceto aquelas que já tenham uma correspondência com o mesmo nome. As colunas de saída sem uma coluna de entrada correspondente se comportam da mesma maneira, conectando-se a todas as colunas de entrada, exceto aquelas cujo nome coincida diretamente.

Criação de um recurso de importação de metadados

Conexão da origem de dados

É possível importar metadados de linhagem do site IBM InfoSphere DataStage apenas por meio de arquivos externos. Você não se conecta diretamente a IBM InfoSphere DataStage. Isso significa que você precisa fornecer apenas uma definição de fonte de dados. Você pode criá-lo antes de começar a criar um ativo de importação de metadados ou pode fazê-lo diretamente no assistente de importação de metadados.

Depois de selecionar uma definição de fonte de dados, a conexão é criada automaticamente. Em seguida, você pode prosseguir com a adição de entradas externas, que são obrigatórias.

Definição de origem de dados

Selecione IBM InfoSphere DataStage como o tipo de fonte de dados.


É possível executar várias importações de metadados para a mesma definição de fonte de dados. A linha de descendência gerada por uma importação de metadados não é sobrescrita quando é executada uma importação de metadados diferente para a mesma definição de fonte de dados. Em vez disso, a linhagem de todas as importações de metadados é combinada. Quando a mesma importação de metadados é executada novamente, sua linhagem gerada anteriormente é atualizada com os resultados da última execução. Com isso, é possível importar a linhagem em lotes menores, como para projetos individuais, por meio de importações separadas de metadados. Vários usuários podem importar a linhagem de diferentes partes da mesma fonte de dados de forma independente, e a linhagem proveniente dessas importações é combinada em uma única visualização de linhagem.

Entradas externas

Você pode fornecer recursos d InfoSphere DataStage, como tarefas, etapas ou arquivos de metadados operacionais, como entradas externas em um arquivo.zip. A pasta deve ter a seguinte estrutura:

  • <job_name.xml> - Os trabalhos do DataStage em paralelo que você deseja analisar e os conjuntos de parâmetros utilizados nesses trabalhos, reunidos em um único arquivo XML, exportado a partir do cliente do designer.
  • omd_files - Uma pasta para arquivos de metadados operacionais (OMD).
    • <omd_file_name> - Arquivos de metadados operacionais coletados durante a execução de tarefas para resolver qualquer tipo de parâmetro nas tarefas.
  • sql_files - Uma pasta que contém todos os arquivos SQL.
    • <sql_file_name> - Um arquivo com consultas SQL.
  • DSParams - Um arquivo que contém os parâmetros no nível do projeto ou do ambiente, se for o caso. Você pode obter esse arquivo no diretório do projeto.
  • datastageParameterOverride.txt - Um arquivo com substituições de conjuntos de parâmetros, caso seus trabalhos utilizem conjuntos de parâmetros.
  • connection_definition/odbcConnectionDefinition.ini - Um arquivo com definições de conexão para conexões do tipo “ ODBC ”. As definições das conexões do ` ODBC ` não estão incluídas nas exportações XML do ` DataStage ` e devem ser especificadas separadamente.
  • datastageComponentOverrides.csv - Um arquivo com substituições de linhagem de componentes.


O formato do datastageParameterOverride.txt arquivo. O datastageParameterOverride.txt arquivo contém o seguinte conteúdo:

[ENVIRONMENT]
PARAM1_NAME = "param1_value"
PARAM2_NAME = "param2_value"
PARAM3_NAME = "param3_value"
[PARAMETER_SET/parameter_set_name]
param4_name  = "default_param4_value"
param5_name  = "default_param5_value"
$PARAM3_NAME = "$PROJDEF"
[VALUE_FILE/parameter_set_name/value_file1_name]
param4_name  = "some_param4_value"
param5_name  = "some_param5_value"
$PARAM3_NAME = "some_param3_value"
[VALUE_FILE/parameter_set_name/value_file2_name]
param4_name  = "other_param4_value"
param5_name  = "other_param5_value"
$PARAM3_NAME = "other_param3_value"
[JOB/job1_name]
param6_name = "param6_value"
param7_name = "param7_value"
[JOB/job2_name]
param7_name = "param8_value"


O formato do connection_definition/odbcConnectionDefinition.ini arquivo. O connection_definition/odbcConnectionDefinition.ini arquivo contém o seguinte conteúdo. Crie uma seção separada [Shortcut_Name] para cada conexão.

[<Shortcut_Name>]
Type=<connection_type>
Connection_String=<connection_string>
Server_Name=<server_name>
Database_Name=<database_name>
Schema_Name=<schema_name>
User_Name=<user_name>
  • Nome do atalho : O nome da conexão ou do servidor de dados utilizado pela ferramenta de integração de dados.
  • connection_type : O tipo de fonte de dados.
  • connection_string : Uma string de conexão do tipo “ JDBC ” ou qualquer identificação do banco de dados, como o ID do sistema (SID) ou o nome do host.
  • server_name : O valor depende do tipo de fonte de dados:
    • Db2, Microsoft SQL Server, Netezza Performance Server, SAP ASE (anteriormente Sybase ) ou Teradata : o nome do servidor.
    • FTP: O nome do servidor.
    • Oracle e outros bancos de dados: o valor é ignorado.
  • nome_do_banco_de_dados : O valor depende do tipo de fonte de dados:
    • Oracle : O nome do banco de dados global.
    • Db2, Microsoft SQL Server, Netezza Performance Server, SAP ASE (anteriormente Sybase ), Teradata e outros bancos de dados: o nome do banco de dados padrão.
    • user_name : O nome do usuário que faz login no banco de dados.

Adicione uma nova linha ao final dos parâmetros de cada seção.


O formato do datastageComponentOverrides.csv arquivo. O datastageComponentOverrides.csv arquivo contém o seguinte conteúdo:

"Full path to Stage";"Input Link name";"Input Column name";"Output Link name";"Output Column name";"Edge Type (DIRECT | FILTER)";"Description (optional)"
"manual_mapping_job/Generic_3";"DSLink2";"a";"DSLink5";"b";"DIRECT";""

O caminho até o palco está no formato Job/[Shared and Local containers optional]/Stage.

Opções de importação avançadas

Perfil de desempenho
Para determinadas fontes de dados, é possível selecionar um perfil de desempenho. Dependendo das suas necessidades atuais, a importação de metadados de linhagem pode ser mais rápida ou mais completa. Você pode escolher entre os seguintes perfis:
  • Rápido : O baixo consumo de tempo e memória são as prioridades neste perfil. Se a sua entrada for muito grande, a linhagem pode não estar completa.
  • Equilibrado : Tanto o desempenho quanto a integridade da linhagem são importantes. Trata-se de um equilíbrio entre a integridade da linhagem e o tempo e a memória dedicados à importação da linhagem.
  • Completude : A completude da linhagem é a prioridade neste perfil. Se o seu conjunto de dados for grande, a importação da linhagem pode consumir uma quantidade significativa de recursos e tempo.
  • Perfil personalizado : Você pode criar seu próprio perfil de desempenho definindo valores para as seguintes propriedades:
    • Limite de tempo de espera da análise de fluxo de dados : Especifica o tempo máximo estimado (em segundos) após o qual a análise de fluxo de dados de uma única entrada é interrompida. O horário é verificado quando cada nó for incluído ou, em alguns casos, quando as bordas forem criadas. Portanto, em alguns casos, o tempo limite pode exceder ligeiramente o limite especificado. Se você definir o valor como 0, a análise não será interrompida. Valor de exemplo: 60.
    • Limite de arestas na análise de fluxo de dados : Especifica o número máximo de arestas permitidas para uma única entrada durante a análise de fluxo de dados. Se esse limite for excedido, todas as bordas de filtro serão removidas e nenhuma outra borda de filtro será incluída. Se o limite ainda for excedido mesmo depois disso, a análise será interrompida e a entrada falhará. Para desativar o limite, configure o valor como "0" (zero). Valor de exemplo: 2500.
Autenticação de usuário proxy do Oracle
Você pode utilizar a autenticação de usuário por proxy do tipo “ Oracle ”. Defina o valor como true para alterar os nomes de usuário do Oracle do \"USERNAME[SCHEMA_OWNER]\" formato para \"SCHEMA_OWNER\" o formato. Em outros casos, defina o valor como false.
Arquivos de valor
Especifique os nomes dos arquivos de valores a serem usados nos Conjuntos de Parâmetros, por ordem de prioridade. Por exemplo, DEV1,TEST,PROD.