IBM DataStage para Cloud Pak for Data configuração de linhagem

Para importar metadados de linhagem de IBM DataStage para Cloud Pak for Data, crie uma conexão, uma definição de fonte de dados e um trabalho de importação de metadados.

Metadados processados

As etapas a seguir são processadas e exibidas no lineage.

  • Etapa de processamento
    • Agregador
    • Filtro BLOOM
    • Aplicação de mudança
    • Captura de mudança
    • Soma de Verificação
    • Comparar
    • Compactar
    • Copiar
    • Mascaramento de Dados
    • Decode
    • Diferença
    • Encode
    • Expandir
    • Filtro externo com restrições: é aplicada uma conexão entre as colunas de entrada e saída.
    • Filtro
    • FTP Corporativo
    • Plug-in FTP
    • Funnel
    • Genérico com restrições: é aplicada uma correspondência sensata entre as colunas de entrada e saída.
    • Head
    • Junção
    • Lookup
    • Mesclar
    • Modificar
    • Peek
    • Tabela Dinâmica
    • Pivot Enterprise
    • Remove Duplicates
    • Row Generator
    • Dimensão de modificação lenta
    • Sort
    • Surrogate Key Generator
    • Comutador
    • Transformador com restrição: as rotinas e funções do ` DataStage ` nas expressões são resolvidas como fluxos diretos.
    • Wave Generator
  • Estágio Quality
    • Regra de Dados
  • estágio File
    • Azure Blob Storage
    • Azure File Storage
    • Cloud Object Storage
    • Arquivo simples complexo
    • Conjunto de dados
    • External Source
    • External Target
    • Conector de Arquivos
    • Conjunto de Arquivos
    • Lookup File Set
    • Sequential File
    • Dado não Estruturado
    • zOS File
  • Estágio Container
    • Contêiner Local
    • Contêiner Compartilhado
  • Etapa do banco de dados
    • Federação clássica com restrição: o fluxo termina em DataStage.
    • Cognos TM1 com restrição: O fluxo termina em DataStage.
    • Db2
    • Distributed Transaction
    • DRS
    • Greenplum
    • HBase com restrição: o fluxo termina em DataStage.
    • Hive
    • Informix Carregamento em massa com restrição: o fluxo termina em DataStage.
    • Informix CLI com restrição: O fluxo termina em DataStage.
    • Informix Empresa com restrições: O fluxo termina em DataStage.
    • iWay -
    • MS SQL
    • Netezza
    • ODBC
    • Oracle
    • PostgreSQL
    • Procedimento armazenado com restrição: os procedimentos armazenados para Sybase e Teradata não são processados.
    • Sybase Carga a granel
    • Sybase Enterprise
    • Sybase OC
    • Teradata
    • BigQuery
Conexão de colunas do Wise
Por padrão, as colunas são associadas entre os conjuntos de dados de entrada e saída com base na correspondência de nomes. Quando uma coluna de entrada e uma coluna de saída têm o mesmo nome, elas são vinculadas diretamente em uma relação de um para um. Se uma coluna de entrada não tiver uma coluna de saída correspondente, ela será conectada a todas as colunas de saída, exceto aquelas que já tenham uma correspondência com o mesmo nome. As colunas de saída sem uma coluna de entrada correspondente se comportam da mesma maneira, conectando-se a todas as colunas de entrada, exceto aquelas cujo nome coincida diretamente.

Criação de um recurso de importação de metadados

Conexão da origem de dados

Para se conectar à fonte de dados da qual você deseja importar metadados de linhagem, é necessário selecionar uma definição de fonte de dados e uma conexão. Você pode criá-los antes de iniciar a importação de metadados ou ao criar e configurar o recurso de importação de metadados.

Definição de origem de dados

Se o seu DataStage para a instância Cloud Pak for Data estiver na mesma instância que IBM Cloud, utilize a definição da fonte de dados IBM Cloud, caso ela já tenha sido criada. Você pode usá-lo para todas as tecnologias do IBM que estiverem implantadas na sua instância do IBM Cloud. No gráfico de linhagem, os dados importados de instâncias do tipo DataStage para o Cloud Pak for Data e outras tecnologias são exibidos no contêiner IBM Cloud.

Em outros casos, selecione “ IBM ” ( DataStage ) para “ Cloud Pak for Data ” como tipo de fonte de dados.

Conexão

Ao criar uma conexão, certifique-se de que estes requisitos sejam atendidos:

  • Para se conectar a DataStage para Cloud Pak for Data, forneça um nome de usuário e uma senha.
  • Para se conectar a DataStage para Cloud Pak for Data as a Service, forneça a chave da API. Se você não tiver uma, no menu de navegação, vá para Administração > Acesso (IAM) > Gerenciar identidades > Chaves de API e crie uma nova chave de API. Use o valor do token nos detalhes da conexão.
  • Especifique um certificado do seu domínio DataStage para a instância Cloud Pak for Data em todos os casos. A conexão pode não ser estabelecida sem o certificado.
  • Configure a conexão com as seguintes propriedades:
    • Tipo de implantação : Obrigatório. Especifique o tipo de ambiente onde a instância de destino do DataStage para Cloud Pak for Data está implantada.
    • URL do token Iam : Opcional. Use esta opção apenas se estiver conectando-se a ambientes de desenvolvimento ou teste, ou outros ambientes que estejam usando IAM personalizado. Especifique um endereço completo URL para um ponto de extremidade usado para gerar tokens IAM. Esta opção é aplicável para tipos de implantação em nuvem.

Para obter detalhes sobre a conexão, consulte DataStage para uma conexão com o Cloud Pak for Data.

Modo de conexão

Você pode se conectar ao DataStage para acessar o Cloud Pak for Data utilizando um dos seguintes modos de conexão:

Listas de inclusão e exclusão

Você pode limitar o escopo da análise de linhagem incluindo ou excluindo explicitamente ativos até o nível de fluxo. Forneça projetos e fluxos no formato project/flow; cada parte é avaliada como uma expressão regular. Os trabalhos, que são criados após a importação dos metadados, também serão incluídos ou excluídos se corresponderem às condições especificadas nas listas. Eles serão processados na próxima vez que a importação de metadados for executada.

Exemplos

Neste exemplo, todos os fluxos do projeto myProject são incluídos ou excluídos:

myProject/

Neste exemplo, o fluxo myFlow1 do projeto myProject3 é incluído ou excluído:

myProject3/myFlow1

Entradas externas

Opcionalmente, você pode fornecer entrada externa na forma de um arquivo.zip. Você adiciona esse arquivo no campo Adicionar entradas do arquivo. Você pode decidir adicionar entrada externa além do escopo definido de dados extraídos ou pode importar dados apenas da entrada externa. Para adicionar uma entrada externa, siga estas etapas:

  1. Prepare um arquivo.zip como uma entrada externa.
  2. Carregue o arquivo.zip no projeto.
  3. Configure a importação para usar somente a entrada externa.

Prepare um arquivo.zip como uma entrada externa

Você pode fornecer fluxos DataStage como entradas externas em um arquivo.zip. A pasta deve ter a seguinte estrutura:

  • <project_export.zip> - Um projeto que foi exportado para um arquivo.zip usando a opção exportar para área de trabalho.
  • DSParams - Um arquivo que contém os parâmetros em nível de projeto ou ambiente, se aplicável. Você pode obter esse arquivo no diretório do projeto.
  • datastageParameterOverride.txt - Um arquivo com substituições de conjuntos de parâmetros se seus trabalhos usarem conjuntos de parâmetros.
  • connection_definition/odbcConnectionDefinition.ini - Um arquivo com definições de conexão para conexões ODBC. As definições das conexões do ODBC não estão incluídas nas exportações do DataStage XML e devem ser especificadas separadamente.
  • datastageComponentOverrides.csv - Um arquivo com substituições de linhagem de componentes.
Observação: Mesmo quando você quiser usar apenas um projeto em um arquivo.zip, esse arquivo.zip do projeto deve ser compactado em outro arquivo.zip para o upload no projeto.

O formato do arquivo.zip com o projeto DataStage exportado
Quando você exporta um projeto DataStage, ele deve ter a seguinte estrutura:

  • assets - pasta necessária.
    • .METADATA - pasta necessária.
    • data_intg_flow.*.json - arquivos necessários que contêm informações sobre fluxos.
    • connection.*.json - arquivos opcionais que contêm informações sobre conexões.
    • parameter_set.*.json - arquivos opcionais que contêm informações sobre conjuntos de parâmetros.
    • job.*.json - arquivos opcionais que contêm informações sobre trabalhos.
    • job_run.*.json -arquivos opcionais que contêm informações sobre determinadas execuções do trabalho.
    • data_intg_flow - pasta necessária.
    • Pelo menos um arquivo que contenha a string "schemas":[{, mas que não termine em px_executables.
  • assettypes - pasta necessária.
  • project.json - arquivo necessário. Pode haver várias instâncias desse arquivo como resultado da descompressão do ZIP, o que está correto.

O formato de arquivo datastageParameterOverride.txt O arquivo datastageParameterOverride.txt tem o seguinte conteúdo:

[ENVIRONMENT]
PARAM1_NAME = "param1_value"
PARAM2_NAME = "param2_value"
PARAM3_NAME = "param3_value"
[PARAMETER_SET/parameter_set_name]
param4_name  = "default_param4_value"
param5_name  = "default_param5_value"
$PARAM3_NAME = "$PROJDEF"
[VALUE_FILE/parameter_set_name/value_file1_name]
param4_name  = "some_param4_value"
param5_name  = "some_param5_value"
$PARAM3_NAME = "some_param3_value"
[VALUE_FILE/parameter_set_name/value_file2_name]
param4_name  = "other_param4_value"
param5_name  = "other_param5_value"
$PARAM3_NAME = "other_param3_value"
[JOB/job1_name]
param6_name = "param6_value"
param7_name = "param7_value"
[JOB/job2_name]
param7_name = "param8_value"

O formato de arquivo connection_definition/odbcConnectionDefinition.ini O arquivo connection_definition/odbcConnectionDefinition.ini tem o seguinte conteúdo. Crie uma seção [Shortcut_Name] separada para cada conexão.

[<Shortcut_Name>]
Type=<connection_type>
Connection_String=<connection_string>
Server_Name=<server_name>
Database_Name=<database_name>
Schema_Name=<schema_name>
User_Name=<user_name>
  • Shortcut_Name : O nome da conexão ou do servidor de dados que é usado pela ferramenta de integração de dados.
  • connection_type : O tipo de fonte de dados.
  • connection_string : Uma cadeia de conexão JDBC ou qualquer identificação do banco de dados, como o ID do sistema (SID) ou o nome do host.
  • server_name : o valor depende do tipo de fonte de dados:
    • Db2, Microsoft SQL Server, Netezza Performance Server, SAP ASE (anteriormente Sybase ), ou Teradata : O nome do servidor.
    • FTP: o nome do host.
    • Oracle e outros bancos de dados: O valor é ignorado.
  • database_name : o valor depende do tipo de fonte de dados:
    • Oracle : O nome do banco de dados global.
    • Db2, Microsoft SQL Server, Netezza Performance Server, SAP ASE (anteriormente Sybase ), Teradata, e outros bancos de dados: O nome do banco de dados padrão.
    • user_name : o nome do usuário que faz login no banco de dados.

Adicione uma nova linha no final dos parâmetros de cada seção.

O formato de arquivo datastageComponentOverrides.csv O arquivo datastageComponentOverrides.csv tem o seguinte conteúdo:

"Full path to Stage";"Input Link name";"Input Column name";"Output Link name";"Output Column name";"Edge Type (DIRECT | FILTER)";"Description (optional)"
"manual_mapping_job/Generic_3";"DSLink2";"a";"DSLink5";"b";"DIRECT";""

O caminho para o estágio está no formato Job/[Shared and Local containers optional]/Stage.

Carregue o arquivo.zip no projeto

Para usar o arquivo.zip na importação de metadados, é necessário adicioná-lo ao projeto em que você criou a importação de metadados.

  1. No projeto, clique em Importar ativos.
  2. Na seção Arquivo local, clique em Ativo de dados.
  3. Adicione o arquivo.zip ao projeto DataStage.

Ao criar a importação de metadados, você poderá selecionar esse arquivo na etapa Adicionar entradas do arquivo.

Configure a importação para usar somente a entrada externa

Se você quiser importar metadados somente da entrada externa fornecida, e não diretamente da instância conectada do DataStage for Cloud Pak for Data, conclua estas etapas:

  1. Adicione o arquivo.zip na seção Add inputs from file (Adicionar entradas do arquivo) e clique em Next (Avançar ).
  2. Expanda a lista de fases de importação de linhagem e desative a fase de extração Transformations (Transformações ).

Opções de importação avançadas

Analisar execuções da tarefa
Especifica se as execuções de trabalho são analisadas.
Analisar execuções da tarefa desde
Especifica a data após a qual as execuções são analisadas. Se o valor estiver vazio, todas as execuções serão analisadas. Exemplo de valor: 1970/01/01 00:00:00.000.
Analisar as tarefas separadamente
Especifica se o trabalho deve ser analisado separadamente, mesmo quando outras execuções estiverem associadas a ele.
Analisar fluxos sem tarefas
Especifica se os fluxos sem trabalhos são analisados.
Autenticação de usuário proxy do Oracle
Você pode usar a autenticação de usuário proxy Oracle. Defina o valor como true para alterar os nomes de usuário de Oracle no formato \"USERNAME[SCHEMA_OWNER]\" para o formato \"SCHEMA_OWNER\" . Em outros casos, defina o valor para false.
Arquivos de valor
Especifique os nomes dos arquivos de valores a serem usados nos conjuntos de parâmetros em ordem de prioridade. Por exemplo, DEV1,TEST,PROD.

Saiba Mais