Gerenciamento de um mecanismo remoto para o DataStage Anywhere

DataStage® Anywhere oferece suporte a manutenção, atualizações e outras considerações sobre dados com mecanismos de tempo de execução remotos.

Manutenção

Com o DataStage Anywhere, o plano de controle permanece hospedado e gerenciado pelo IBM Cloud.

Gerencie seu plano de dados por meio do mecanismo remoto. Para obter mais informações sobre como gerenciar um mecanismo remoto, consulte DataStage Remote Engine usando Docker. Para atualizar seu mecanismo remoto com os scripts automatizados, baixe a imagem do contêiner para seus registros internos e faça a implantação. Os scripts contêm informações sobre os controles, incluindo a criação, a execução, a limpeza e a atualização de um mecanismo remoto.

Ajuste de escala

É possível incluir ou remover mecanismos remotos para escalar implementações durante o mês. Não há limite de implementação, mas você é cobrado pela quantia máxima de VPCs implementadas a cada mês, independentemente de serem ou não usadas ou não.

Recuperação de desastre

Implemente mecanismos remotos adicionais para suportar a recuperação de desastre

Observabilidade de dados

É possível colocar uma solução de observabilidade no lugar dentro de sua plataforma de gerenciamento de contêiner Databand está integrado ao DataStage Anywhere e pode monitorar os pipelines do DataStage.

Armazenamento

O operador DataStage monta o armazenamento padrão para os pods Kubernetes do mecanismo remoto. Para adicionar armazenamento adicional com volumes persistentes, consulte “Configurando uma montagem do NFS ” em DataStage.

Ativação de local alternativo Cloud Object Storage para registros remotos do mecanismo

Por padrão, os registros de execução de tarefas do mecanismo remoto são enviados para o bucket padrão no IBM Cloud® Object Storage (COS). Você pode ativar um local alternativo do COS para armazenar os logs de execução do trabalho.

Para desativar o envio de registros de execução de tarefas para o bucket padrão do IBM Cloud Object Storage na implantação do Kubernetes, use o seguinte comando:
kubectl -n <namespace> set env deployment/<instance-name>-ibm-datastage-px-runtime DISABLE_REMOTE_LOG_PUSH=true
Para habilitar o envio de logs para o local alternativo do COS na implantação do Kubernetes, use o seguinte comando, que cria o segredo contendo o novo local do COS:
kubectl -n <namespace> create secret generic datastage-log-cos-location \
--from-literal=CUSTOM_S3_BUCKET_NAME=<bucket-name> \
--from-literal=CUSTOM_S3_REGION=<region> \
--from-literal=CUSTOM_S3_ENDPOINT=<endpoint> \
--from-literal=CUSTOM_S3_ACCESS_KEY=<access-key> \
--from-literal=CUSTOM_S3_SECRET_KEY=<secret-key>
Este comando reinicia o pod. Se você usar o comando de desativação primeiro, será necessário reiniciar o pod manualmente.

Importação/exportação de ativos

Para evitar problemas de configuração do ambiente de trabalho, use a função DataStage função específica de importação/exportação.

  1. Crie um novo projeto e atualize as configurações do projeto para vinculá-lo ao mecanismo remoto.
  2. Use o site cpdctl dsjob para exportar ativos do projeto original.
  3. Use cpdct dsjob para importar ativos para o novo projeto que está vinculado ao mecanismo remoto.

Configuração de informações de proxy

A implantação de contêineres oferece suporte a informações de proxy. Para definir as informações de proxy para um mecanismo remoto do DataStage Anywhere, defina a seguinte variável de ambiente no contêiner:
REMOTE_HTTPS_PROXY=http://username:password@host:port

Não há informações de proxy disponíveis para a implantação do Kubernetes.

DataStage estrutura de diretório

Projetos

/ds-storage/PXRuntime/Projects
/ds-storage/PXRuntime/Projects/project-id
Fluxos

Diretório de fluxos onde os artefatos compilados para o fluxo são armazenados com base no ID do fluxo:


/ds-storage/PXRuntime/Projects/project-id/flows
/ds-storage/PXRuntime/Projects/project-id/flows/flow-id
/ds-storage/PXRuntime/Projects/project-id/flows/flow-id/lib
/ds-storage/PXRuntime/Projects/project-id/flows/flow-id/scripts
Tarefas

Diretório de trabalhos em que os artefatos de tempo de execução são armazenados para cada trabalho com base no ID do trabalho e para cada execução com base no ID da execução:


/ds-storage/PXRuntime/Projects/project-id/jobs/job-id
/ds-storage/PXRuntime/Projects/project-id/jobs/job-id/runs/run-id

Limitação do nome do recurso personalizado

Ao configurar um recurso personalizado (CR), o nome do CR deve ter menos de 28 caracteres.

Configuração de parâmetros em um nível de trabalho ou projeto

Você pode substituir manualmente os parâmetros em um nível de trabalho ou projeto usando o comando cpdctl no pod do mecanismo remoto.

Em um nível de trabalho, você pode fornecer a seguinte variável de ambiente: APT_PARAM_VALUE_FILE com um arquivo de parâmetro para substituir como valor. Por exemplo:
APT_PARAM_VALUE_FILE=/ds-storage/param.txt

Em um nível de projeto, execute o seguinte comando: /ds-storage/PXRuntime/Projects/<projectId>/.local_jpfile no diretório sugerido.

Ativação de métricas para o mecanismo remoto

Para habilitar a coleta de métricas, implante o mecanismo remoto com a seguinte variável de ambiente, utilizando a --env-vars opção do script dsengine.sh de implantação:
ENABLE_DS_METRICS=true
Essa configuração se aplica a todo o ambiente de execução do mecanismo remoto e a todos os trabalhos e projetos que o utilizam. As configurações do projeto determinam onde as métricas são armazenadas, mas não ativam nem desativam a coleta de métricas.

Se o motor remoto já estiver em execução, pare-o e remova o contêiner; em seguida, reimplante-o com ENABLE_DS_METRICS=true. Não é necessária nenhuma recompilação do trabalho, e o ID do mecanismo remoto é preservado.

Para verificar se a coleta de métricas está habilitada, verifique os logs de inicialização do contêiner e confirme se eles indicam que as métricas estão habilitadas, mostram a região de destino e relatam uma conexão bem-sucedida com o plano de controle.

Você também pode configurar a variável de ambiente opcional DS_METRICS_CLIENT_THREADS para controlar o número de threads que alimentam o banco de dados de métricas:
DS_METRICS_CLIENT_THREADS=<value>
O valor padrão é 10. Aumente esse valor somente se você observar, de forma consistente, um atraso de mais de um minuto entre a conclusão do trabalho e o aparecimento das métricas no banco de dados de métricas. Essa configuração se aplica a todo o ambiente de execução do mecanismo remoto e não pode ser definida por projeto.

Para obter uma lista das variáveis de ambiente do mecanismo remoto compatíveis, consulte a Referência de variáveis de ambiente do mecanismo remoto.