Projetando fluxos DataStage

DataStage® fluxos são os ativos de tempo de design que contêm lógica de integração de dados.

Você pode criar um fluxo DataStage vazio e adicionar conectores e estágios a ele ou você pode importar um fluxo existente do DataStage a partir de um arquivo ISX ou ZIP.

Os blocos de construção básicos de um fluxo são:
  • Origens de dados que leem dados
  • Estágios que transformam os dados
  • Destinos de dados que gravam dados
  • Links que conectam as origens, os estágios e os destinos

Paleta e tela no IBM DataStage

DataStage fluxos e seus objetos associados são organizados em projetos. Para iniciar, abra um projeto existente ou crie um novo projeto.

Criando um Fluxo DataStage

Se você tiver um IBM Knowledge Catalog o, é necessário ter a Access data preview permissão para criar fluxos d DataStage.

Para criar um fluxo DataStage , complete as etapas a seguir.

  1. Abra um projeto existente ou crie um projeto.
  2. Na guia " Ativos ", clique em "Novo ativo +" > "Transformar e integrar dados".
  3. Na página Criar um fluxo DataStage , use um dos dois métodos a seguir para criar o fluxo DataStage :
    • Clique na guia Novo , inclua os detalhes necessários para o fluxo DataStage , em seguida, clique em Criar. O novo fluxo do DataStage é aberto sem objetos na tela do designer DataStage .
    • Clique na guia Arquivo local , em seguida, faça o upload de um arquivo ISX ou ZIP de seu computador local. Você precisa escolher a opção de conflitos de ativos: Renomear, Substituir ou Ignorar. Em seguida, clique em Criar.
    • Quando o processo de importação estiver concluído, feche a página do relatório de importação e abra o fluxo DataStage importado na guia Ativos do projeto. Quando você importa pela primeira vez, o status exibe Imported Successfully. No entanto, se você tentar reimportar o mesmo ativo usando a opção Substituir, o sistema deverá atualizar o ativo existente. Em vez disso, ele mostra incorretamente um Skipped status. É um problema conhecido que afeta todos os tipos de ativos, exceto o fluxo DataStage, que se comporta conforme o esperado e é o foco desta documentação.
  4. Arraste conectores ou estágios da paleta sobre a tela de design DataStage como nós e organize-os como quiser. Conecte estes nós na tela ao passando o ponteiro sobre um nó para fazer uma seta aparecer no nó, em seguida, clique no ícone de seta e arraste-o para o nó ao qual você deseja se conectar.

    Para se conectar a dados remotos, consulte “Conectando-se a uma fonte de dados” em DataStage.

  5. Clique duas vezes em um nó para abrir seu painel de propriedades, onde é possível especificar configurações e configurações para o nó.
  6. Clique em Executar .

    O fluxo é automaticamente salvo, compilado e executado. É possível visualizar logs para a compilação e a execução da tarefa.

Após o fluxo ser compilado em um job, é possível reexecutar a tarefa, configurar um planejamento, monitorar a tarefa e atualizar o ambiente que deseja executá-lo em. Para obter mais informações sobre como atualizar o ambiente do DataStage, no qual deseja que seus trabalhos sejam executados, consulte a seção “Configurando definições do ambiente d DataStage ” em DataStage environments.

Editando um fluxo DataStage

Se você tiver um IBM Knowledge Catalog o, é necessário ter permissão Access data preview para editar os fluxos do DataStage.

Você pode usar as seguintes ações para editar um fluxo DataStage .

  • Arraste um estágio ou conector e solte-o em um link entre dois nós que já estão na tela de design do DataStage . Os links são automaticamente incluídos no novo nó e as colunas são propagados automaticamente. Clique em Executar novamente para ver os resultados.
  • Desconecte e reconecte manualmente os links dos nós na tela do DataStage passando o ponteiro sobre eles e clicando nos terminais dos links.
  • Arraste um estágio ou conector da paleta e solte-o em um link que já está na tela. O estágio ou conector é automaticamente vinculado ao nó em qualquer um dos lados dele e as colunas no fluxo DataStage automaticamente propagado.
  • Clique no ícone ícone circular de atualização "Substituir" e selecione outro fluxo para substituir o seu. Essa ação também está disponível para os estágios Build, Custom e Wrapped, bem como para subfluxos e bibliotecas Java.

Visualizando Dados

Se você tiver um IBM Knowledge Catalog e, é necessário ter permissão Access data preview para acessar visualizações de ativos nos projetos e visualizar ativos por meio dos fluxos do DataStage e nos espaços de implantação.

Você pode editar e visualizar dados no fluxo DataStage. Na tela, clique com o botão direito do mouse em sua conexão e selecione Preview Data (Visualizar dados). Você pode visualizar seus dados com todas as conexões e conectores de arquivos. Para obter mais informações sobre conectores de arquivo, consulte a seção “Conectores de arquivo” em DataStage.

Por exemplo, você pode visualizar a hora e o microssegundo com o fuso horário. Os tipos de dados ' time e ' microseconds time aparecem no formato padrão: HH:mm:ss para tempo e ' HH:mm:ss.SSSSSS para tempo em microssegundos.

Para os tipos de dados de hora, carimbo de data/hora e microssegundos que contêm o fuso horário, DataStage ajusta a hora com base no fuso horário e exibe a hora UTC no formato padrão. Por exemplo:
Input time: 00:00:01-10:00
Local Time: 00:00:01
offset: -10 (which means UTC is 10 hours ahead of local time)
UTC Time: LocalTime + Offset = 00:00:01 + 10 hrs = 10:00:01
em que o fuso horário é convertido e exibido como " 10:00:01 no formato de hora padrão.

Considerações

Informações confidenciais e valores de propriedade criptografados
Não é recomendado especificar valores de propriedade criptografados, como senhas, nos fluxos do DataStage Em vez disso, crie um conjunto de parâmetros do tipo Encrypted com um parâmetro nomeado e não especifique um valor padrão para o parâmetro. Em seu fluxo, faça referência ao conjunto de parâmetros criptografados e especifique o parâmetro nomeado para o valor da propriedade, ex: #<parameter set>.<parameter name>#. Especifique o valor criptografado do parâmetro #parameter set.parameter name# na tarefa que está executando seu fluxo.
Como nomear arquivos em fontes e destinos para evitar a corrupção de dados
Na maioria dos casos, não utilize o mesmo nome de arquivo na origem como no destino se a origem e o destino apontar para o mesmo banco de dados ou sistema de armazenamento. Esta regra se aplica a arquivos e tabelas de banco de dados. Se os nomes forem os mesmos, os dados podem ser corrompidos.
Propagação de mudança de metadados da coluna
Quando você altera metadados de uma coluna, as mudanças são propagadas automaticamente no recebimento de dados. As mudanças feitas no envio de dados não se aplicam a uma coluna depois de modificar seus metadados. Se você excluir uma coluna, modificar a coluna em um estágio posterior não incluirá a coluna novamente.
Propagação de coluna no tempo de execução
Quando o RCP for configurado, se sua tarefa encontrar colunas extras que não estejam definidas nos metadados quando ela for executada, ela adotará essas colunas extras e as propagará pelo restante da tarefa. Isso evita erros devido a mapeamentos ausentes
Adicionando parâmetros
Consulte Incluindo parâmetros..

Saiba Mais

Exemplos

Criando um Fluxo DataStage

Assista ao vídeo a seguir para um exemplo de como criar um fluxo simples DataStage .

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.

Importando um fluxo DataStage em um projeto

Assista ao vídeo a seguir para um exemplo de como importar um fluxo DataStage em um projeto.

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.