Particionar e coletar dados no DataStage

Use a seção Particionamento nos estágios ou conectores do DataStage® que possuem guias de Entrada para especificar detalhes sobre como o estágio ou o conector particiona ou coleta dados no link atual antes de processar os dados ou gravá-los em um destino de dados

Particionamento de dados é uma abordagem para paralelismo que envolve a quebra do conjunto de registros em partições ou subconjuntos de registros. Se não existirem restrições de recursos ou outros problemas de distribuição não uniforme de dados, o particionamento de dados poderá fornecer aumentos lineares no desempenho do aplicativo. DataStage particiona dados automaticamente com base no tipo de partição que o estágio requer.

Também é possível usar a seção Particionamento para classificar dados que estão chegando no link de entrada antes que os dados sejam processados ou gravados no destino de dados. A disponibilidade de classificação depende do método de particionamento ou coleta que for escolhido. Ele não está disponível com os métodos Automático. A seção Particionamento fornece instalações básicas de classificação. Para uma operação de classificação mais complexa, utilize o estágio Sort.

A seção Particionamento contém os seguintes controles e campos:
Particionamento
Escolha o tipo de particionamento da lista.
A lista Tipo de partição estará disponível se o Modo de execução estiver configurado como paralelo na guia Estágio. Se você selecionar um método na lista, ele substituirá qualquer método de particionamento atual.
Os tipos de particionamento a seguir estão disponíveis:
(Automático)
No tempo de execução, o mecanismo tenta realizar o melhor método de particionamento, dependendo de:
  • Se os estágios atuais e anteriores são configurados para execução em modo sequencial ou em modo paralelo.
  • Se estágios anteriores na tarefa têm a opção Preservar particionamento configurada.
  • Quantos nós são especificados no arquivo de configuração.
Automático é o método padrão para a maioria dos estágios, mas ele não está disponível para o estágio Lookup File Set ou para o estágio Enterprise do DB2.
DB2 Connector
Esse tipo de partição está disponível somente para o conector IBM Db2 for DataStage . Quando esse método é especificado, o conector determina o número de partições na tabela especificada na propriedade Método de leituras particionadas > Nome da tabela e configura dinamicamente o número de nós para corresponder ao número de partições. Para tabelas Db2® for LUW (Linux, Unix e Windows), esse número é o número de partições DPF (Database Partitioning Feature) que estão na tabela. Para tabelas do Db2 for z/OS® , esse número é o número de partições de tabelas na tabela O conector associa cada nó a uma partição. Para cada nó, o conector lê as linhas que pertencem à partição associada a esse nó.
Inteiro
Todo nó de processamento recebe o conjunto de dados inteiro.
Aleatório
As linhas são particionadas aleatoriamente, com base na saída de um gerador de número aleatório.
Round-robin
As linhas são particionadas em uma base round-robin à medida que entram no estágio.
Igual
Este método preserva as partições de dados atuais.
Módulo
As linhas são particionadas usando uma função modulus na coluna de chave.
Hash
As linhas são amassadas em partições com base no valor de uma ou mais colunas chave.
Intervalo
Este método divide um conjunto de dados em partições de tamanho aproximadamente igual com base em uma ou mais teclas de particionamento. O particionamento de intervalo é geralmente uma etapa preparatória para desempenhar uma classificação total em um conjunto de dados.
Coleção
Escolha o tipo de coleta da lista.

A lista Tipo de coleção estará disponível se o estágio estiver configurado para executar no modo sequencial e o estágio anterior estiver configurado para executar no modo paralelo. Se você selecionar um método na lista, ele substituirá o método de coleta padrão de Automático.

Os tipos de coleta a seguir estão disponíveis:
(Automático)
O método Automático geralmente faz com que o estágio leia qualquer linha de qualquer partição de entrada à medida que a linha se torna disponível e é o método de coleta mais rápida. No entanto, o estágio pode usar um método de coleta diferente quando Automático é configurado em algumas circunstâncias. Por exemplo, se o estágio exigir que os dados sejam classificados antes de poderem operar, ele classificará os dados.
Ordenados
Este método lê todas as linhas da primeira partição, depois todas as linhas da segunda partição, e assim por diante.
Round-robin
Este método lê uma linha da primeira partição de entrada, depois uma linha da segunda partição, e assim por diante. Depois de atingir a última partição, o estágio começa novamente da primeira partição.
Classificar mesclagem
Este método lê linhas em uma ordem baseada em uma ou mais colunas da linha.
Classificação
Use esses controles para especificar como classificar os dados. Os dados são sempre classificados dentro de partições de dados. Se o estágio estiver particionando dados recebidos, os dados serão classificados após o particionamento. Se o estágio estiver coletando dados recebidos, eles serão classificados antes da coleta.
Sort
Selecione Executar classificação para classificar dados que chegam ao link.
Estável
Selecione Estável se você deseja preservar conjuntos de dados previamente classificados. Estável é configurado por padrão.
Exclusivo
Selecione Exclusivo se desejar reter apenas um registro por valor da chave de classificação. Se vários registros possuem valores de chave de classificação idênticos, todos, exceto um, serão descartados. Se classificação estável também for configurada, o primeiro registro com o valor da chave de classificação será o registro retido.

Arquivos de configuração gerados dinamicamente no DataStage

DataStage não oferece suporte a arquivos de configuração gerados pelo usuário. Você pode fornecer o número de partições para arquivos de configuração gerados dinamicamente definindo a contagem de partições no ambiente de tempo de execução ou definindo a variável de ambiente ' APT_WLM_PARTITION_COUNT para o número de partições.