Especificação de métodos de particionamento ou coleta (DataStage)

É possível especificar como os dados são coletados ou particionados antes que sejam processados.

Dados de particionamento

Sobre essa tarefa

Se o estágio estiver executando em modo paralelo, ele processará os dados em partições. Por padrão, o método de particionamento é configurado como Automático. É possível substituir o comportamento padrão.

Procedimento

  1. Abra a guia Particionamento da página Entrada .
  2. Selecione um método de particionamento na lista:
    Opção Descrição
    (Automático) O IBM® DataStage® tenta descobrir o melhor método de particionamento, dependendo dos modos de execução de estágios atuais e anteriores e de quantos nós são especificados no arquivo de Configuração Este é o método de particionamento padrão para a maioria dos estágios.
    Db2 Replica o método de particionamento Db2 de uma tabela Db2 específica. Requer propriedades extras a serem definidas. Acesse essas propriedades clicando no botão de propriedades.
    Inteiro Cada arquivo gravado recebe o conjunto de dados completo.
    Hash Os registros são submetidos a hash em partições com base no valor de uma coluna ou colunas de chave selecionadas na lista Disponível.
    Módulo Os registros são particionados usando uma função de módulo na coluna de chave selecionada na lista Disponível. Geralmente isso é usado para a partição nos campos de tag.
    Aleatório Os registros são particionados de forma aleatória, com base na saída de um gerador de números aleatórios.
    Round-robin Os registros são particionados em uma base round-robin conforme entram no estágio.
    Igual Preserva o particionamento já disponível.
    Intervalo Divide um conjunto de dados em partições de tamanhos aproximadamente iguais com base em uma ou mais chaves de particionamento. O particionamento de intervalo é geralmente uma etapa de pré-processamento para desempenhar uma classificação total em um conjunto de dados. Requer propriedades extras a serem definidas. Acesse essas propriedades clicando no botão de propriedades.
  3. Se você selecionou os métodos de particionamento de hash ou modulus, especifique uma chave clicando em uma ou mais das colunas na lista Disponível . A coluna ou colunas selecionadas aparecem na lista Selecionado.

Coletando dados

É possível especificar um método de coleta.

Sobre essa tarefa

Se o estágio for executado sequencialmente e o estágio anterior na tarefa for executado em paralelo, os dados serão coletados antes de serem gravados. Por padrão, o método de coleta é configurado como Automático. É possível substituir o comportamento padrão.

Procedimento

  1. Abra a guia Particionamento da página Entrada .
  2. Selecione um método de coleta na lista:
    Opção Descrição
    (Automático) Este é o método de coleta padrão para o estágio Sequential File. Normalmente, quando você estiver usando o modo Automático, o IBM DataStage lerá qualquer linha de qualquer partição de entrada à medida que ela se tornar disponível.
    Ordenados Lê todas as linhas da primeira partição e, em seguida, todas as linhas da segunda partição e assim por diante.
    Round-robin Lê uma linha da primeira partição de entrada e, depois, da segunda partição e assim por diante. Depois de atingir a última partição, o operador começa por cima.
    Classificar mesclagem Lê linhas em uma ordem baseada em uma ou mais colunas da linha. Isto requer que você selecione uma coluna de chave de coleta na lista Disponível.
  3. Se você selecionou o método de coleta do Sort Merge, especifique uma chave coletante, clicando em uma ou mais das colunas na lista Disponível . A coluna ou colunas selecionadas aparecem na lista Selecionado.