Execução de tarefas DataStage
Componentes que compõem um trabalho DataStage
- Um fluxo DataStage
- Um ambiente de execução
- Parâmetros da tarefa
- Conjuntos de parâmetros
Relações de trabalho
DataStage fluxos podem ter um relacionamento one-to-many com empregos DataStage . Você pode usar um fluxo DataStage para criar vários empregos.
Empregos de multi-instância
Todos os empregos DataStage podem ser instanciados várias vezes, resultando em várias execuções de tarefas ou chamadas de um mesmo trabalho não modificado. Não é necessário aguardar uma tarefa para concluir o envio de uma nova solicitação de execução de tarefa para essa tarefa Você pode enviar uma nova solicitação de execução de tarefa por meio da API REST, linha de comando (cpdctl) ou o painel de Jobs. Você também pode usar várias chamadas de um mesmo trabalho para processar conjuntos de dados diferentes configurando parâmetros diferentes para cada execução. Cada DataStage job run tem um ID run ID.
O desenvolvedor que projeta o trabalho é responsável por garantir que várias execuções de tarefas não entrem em conflito entre si. Por exemplo, chamadas diferentes que estão em execução conatualmente podem escrever para a mesma tabela. Várias execuções de um trabalho também podem afetar negativamente o desempenho do trabalho.
Você pode definir um valor DSJobInvocationId para aparecer como o "Nome" da execução do trabalho no painel Trabalhos, para que você possa localizar uma execução de trabalho específica pelo nome. Você pode definir o DSJobInvocationId criando um parâmetro ou uma variável de ambiente. Você pode definir o DSJobInvocationId em um pipeline ou quando iniciar o DataStage trabalho (com a linha de comando, por exemplo).
Opcionalmente, você pode especificar um nome de execução de trabalho ao executar um fluxo de pipeline ou um trabalho de pipeline e ver as diferentes execuções de trabalho no painel Detalhes do trabalho. Caso contrário, você também pode atribuir um parâmetro local DSJobInvocationId a um nó Executar trabalho de pipeline ou Executar trabalho de DataStage (o último não está disponível para watsonx). Se o parâmetro DSJobInvocationId e o nome de execução do trabalho do nó estiverem definidos, DSJobInvocationId será usado. Se nenhum dos dois estiver definido, o valor padrão "execução de trabalho" será usado.
Você não precisa criar o DSJobInvocationId para criar um trabalho de várias instâncias.
Os DataStage trabalhos paralelos e sequenciais migrados importam DSJobInvocationId como parâmetro.
DataStage instâncias de tarefas que são chamadas separadamente são diferentes das instâncias que são geradas quando você executa um trabalho particionado em vários processadores. O particionamento integrado e coleta manipula a situação em que vários processos querem ler ou escrever para a mesma fonte de dados para trabalhos particionados.
Criando um job a partir do canvas de design DataStage
Para criar um DataStage trabalho diretamente no DataStage, você deve criar o trabalho a partir da DataStage tela de design em um fluxo DataStage.
- Abra um fluxo DataStage .
- Opcional: Clique no ícone Configurações na barra de ferramentas para abrir a página Configurações e especificar configurações para a tarefa.
- Clique em Compilar para compilar o fluxo DataStage .
- Clique em Executar para executar o fluxo DataStage .
Uma tarefa é criada e executada automaticamente. Após os acabamentos de execução, ele é listado na guia Jobs no projeto em que seu fluxo DataStage está em.
Criando um job a partir do nível do projeto
Você pode criar um trabalho a partir da guia Ativos do seu projeto.
- Selecione um fluxo do DataStage na lista na guia Ativos do projeto. Selecione Criar trabalho no ícone do menu com as listas de opções
no final da linha da tabela. - Defina os detalhes da tarefa, inserindo um nome e uma descrição (opcional).
- Especifique as configurações que você deseja para a tarefa.
- Na página Planejamento , você pode, opcionalmente, adicionar uma programação única ou de repetição.
Se você definir um dia e hora de início sem selecionar Repetir, a tarefa será executada exatamente uma vez no dia e horário especificados. Se você definir uma data e hora de início e você selecionar Repetir, a tarefa será executada pela primeira vez no timestamp que é indicado na seção Repetir.
Não é possível mudar o fuso horário; o planejamento usa a configuração de fuso horário do seu navegador da web. Se você excluir determinados dias da semana, a tarefa poderá não ser executada como você esperaria. Isso pode ocorrer devido a uma discrepância entre o fuso horário do usuário que cria o planejamento e o fuso horário do nó de cálculo no qual a tarefa é executada.
- Opcionalmente, configure para ver as notificações para a tarefa. É possível selecionar o tipo de alertas para receber.
- Revise as configurações da tarefa. Em seguida, crie a tarefa e execute-a imediatamente ou crie a tarefa e execute-a posteriormente.
Criar um job a partir da linha de comando cpdctl dsjob utilitário
Você pode criar uma tarefa DataStage usando um fluxo existente do DataStage com o utilitário de linha de comando dsjob cpdctl, cpdctl dsjob create-job.
cpdctl dsjob create-job --project DataStageProjectName --flow DataStageFlowName \
--description "This is a test job created from command line" \
--schedule-start 2022-11-07 \
--schedule-end 2022-12-08 \
--repeat hourlyExecutando Tarefas
Para executar um trabalho manualmente, você pode clicar no ícone de execução
da barra de ferramentas na DataStage. É possível iniciar uma tarefa planejada com base no planejamento e sob demanda.
Você também pode executar um trabalho manualmente, clicando no ícone de execução a partir da barra de ferramentas quando estiver visualizando os detalhes do trabalho para um determinado trabalho. Os empregos podem ser planejados ou podem ser executados sob demanda. Além disso, os empregos podem ser executados usando a API ou o utilitário da linha de comando.
Gerenciando Tarefas
- Clique no ícone Editar filtros para filtrar por diferentes critérios, como tipo de ativo e planejamento.
- Clique no menu suspenso de Jobs ao lado do campo de busca de tarefas para filtrar por critérios como empregos com execuções ativas, execuções ativas, empregos com execuções terminadas e execuções acabadas.
- Inserir informações no campo de busca para procurar empregos específicos.
Visualizando detalhes da execução da tarefa e métricas de execução
Clique em um nome de trabalho na lista de trabalhos para revisar as informações e detalhes da execução. A página de detalhes do trabalho também lista o nome da execução se ele tiver sido definido usando o parâmetro DSJobInvocationId.
Você pode selecionar uma determinada execução para um trabalho e revisar os detalhes da execução. Os detalhes da execução incluem a duração, as horas de início e término, o usuário que iniciou a execução, o trabalho associado, o nome da execução e o fluxo DataStage associado. Configurações e valores de parâmetros de tempo de execução são listados. O log de execução de tarefas para as execuções também é mostrado. O registro de data e hora mostrado no log é o da instância do servidor px-runtime em GMT. Ele não é convertido para o código de idioma do usuário enquanto você navega no log Se quiser que os logs de execução do trabalho sejam exibidos em um fuso horário diferente, consulte: Como definir o fuso horário em DataStage.
Clique em Executar métricas nos detalhes de execução para visualizar as métricas de execução da tarefa. Visualize um resumo de métricas para o fluxo geral ou procure por links e etapas específicos É possível filtrar as métricas de execução com base no status (em andamento, com falha ou concluído)
Também é possível acessar as métricas de execução de dentro de um fluxo clicando no botão Executar métricas na barra de ferramentas da tela. Clique em um link ou estágio na lista de métricas para mover o foco para ele no canvas.