Amazon S3 conector ( DataStage )

Use o conector Amazon S3 no DataStage® para se conectar ao Amazon Simple Storage Service ( S3 ) e executar várias funções de leitura e gravação.

Pré-requisito

Estabeleça a conexão. Para obter instruções, consulte Conectando-se a uma fonte de dados em DataStage e o Amazon S3 conexão.

DataStage propriedades

Na seção Propriedades da guia Palco, selecione Usar propriedades do DataStage para acessar as propriedades específicas do DataStage. Essas propriedades fornecem mais recursos e controle granular da execução do fluxo, semelhantes aos conectores "otimizados".

Se você selecionar “Usar propriedades do DataStage ” com um arquivo. CSV, os valores das colunas devem estar entre aspas duplas. Se for necessário fazer alguma personalização, use as propriedades de formato de arquivo do conector para alterar o formato do arquivo para "Delimitado". Em seguida, selecione o delimitador de campo, o delimitador de linha, o caractere de aspas e o caractere de escape.

Limpe as propriedades " DataStage " para acessar as opções da propriedade "Formato da tabela".

Se você selecionar “Usar propriedades do DataStage ”, utilize o endpoint correto URL ao acessar o bucket. Se você quiser acessar o bucket em uma região diferente, não utilize o endpoint URL. O acesso entre regiões não é compatível quando são fornecidos pontos de extremidade.

Para o desenvolvimento de novos fluxos, utilize a abordagem do conector de plataforma. Quando a opção “Usar propriedades do DataStage ” está desativada, o DataStage utiliza o conector de última geração recomendado. Ao usar o conector da plataforma, configure a autenticação por token de sessão diretamente nas propriedades da conexão. Os tokens de sessão não são compatíveis quando a opção “Usar propriedades d DataStage ” está ativada.

Configurando o conector do Amazon S3 como fonte

As propriedades disponíveis para o modo de leitura dependem da seleção da opção “Usar propriedades d DataStage ”.

Configure o processo de leitura para um conector d Amazon S3 e ao selecionar “Usar propriedades d DataStage ” (padrão).
Tabela 1. Lendo dados de Amazon S3 com a opção "Usar propriedades do DataStage " selecionada
Modo de leitura Procedimento
Ler um arquivo único Especifique o nome do bucket que contém o arquivo e, em seguida, especifique o nome do arquivo a ser lido.
Ler diversos arquivos
  1. Especifique o nome do bucket que contém os arquivos.
  2. No campo " Nome do arquivo", especifique um prefixo que os arquivos que você deseja ler devem ter em seu caminho de arquivo.

    Por exemplo, se você inserir transactions como prefixo, o conector lê todos os arquivos na transactions pasta, como transactions/january/day1.txt, e um arquivo chamado transactions.txt.

Listar depósitos Nenhuma configuração adicional é necessária.
Listar arquivos
  1. Especifique o nome do bucket que contém os arquivos.
  2. Opcional: No campo Nome do arquivo, especifique um prefixo que os arquivos que você deseja ler devem ter em seu caminho.

    Por exemplo, se você digitar transactions como prefixo, o conector listará todos os arquivos na transactions pasta, como transactions/january/day1.txt, e um arquivo chamado transactions.txt.

    Se você não especificar um prefixo para o nome do arquivo, todos os arquivos no contêiner do bucket serão listados.

Configure o processo de leitura para um conector do Amazon S3 e ao desmarcar a opção “Usar o DataStage ” nas propriedades.

Tabela 2. Lendo dados de um arquivo ` Amazon S3 ` com a opção "Usar propriedades do ` DataStage `" desmarcada
Modo de leitura Procedimento
Ler um arquivo único Especifique o nome do bucket que contém o arquivo e, em seguida, especifique o nome do arquivo a ser lido.
Ler dados binários Especifique o nome do bucket que contém o arquivo e, em seguida, especifique o nome do arquivo a ser lido.
Leia dados binários de vários arquivos usando caracteres curinga Especifique um caractere curinga no nome do arquivo para dados binários. Por exemplo, no campo “Nome do arquivo”, digite test.*.gz.

Se você usar essa opção, poderá ler vários arquivos binários, um após o outro, e cada arquivo será lido como um registro.

Se você selecionar “Ler um arquivo em uma linha ”, deverá fornecer dois nomes de colunas na guia “Saída” do estágio de origem:

  • A primeira coluna deve ser do tipo de dados string. Esta coluna é destinada ao nome do arquivo.
  • A segunda coluna deve ser do tipo de dados binário. Esta coluna é para arquivo. O valor da precisão da coluna binária deve ser maior ou igual ao tamanho máximo do arquivo.
Ler vários arquivos usando expressões regulares Especifique o nome do bucket que contém os arquivos. Você pode usar uma expressão regular Java para o nome do arquivo.

Exemplos:

  • ^csv_write_datatypes_h.[0-9]$
  • csv_write_datatypes_h.[^12]
Leia vários arquivos usando caracteres curinga Especifique um asterisco (*) para corresponder a zero ou mais caracteres. Por exemplo, especifique *.txt para localizar todos os arquivos com a extensão.txt.

Use um ponto de interrogação (?) para corresponder a um caractere.

Exemplos:

  • csv_write_datatypes.*
  • ?_abc_test*

Configurando o conector do Amazon S3 como destino

As propriedades disponíveis para o modo de gravação dependem da seleção da opção “Usar propriedades d DataStage ”.

Configure o processo de gravação para um conector d Amazon S3 e ao selecionar “Usar propriedades d DataStage ” (padrão).
Tabela 3. Gravar dados em um arquivo ` Amazon S3 ` com a opção "Usar propriedades de ` DataStage `" selecionada
Modo de Gravação Procedimento
Excluir um arquivo
  1. Especifique o nome do bucket que contém os arquivos ou selecione Criar bucket.
  2. No campo Nome do arquivo, especifique o nome do arquivo a ser excluído.
Gravar em um arquivo
  1. Especifique o nome do bucket que contém os arquivos.
  2. Se você deseja criar um bucket que contenha os arquivos a serem gravados, defina a opção “Criar bucket” como “Sim”. Em seguida, você pode selecionar a opção “Anexar ID exclusivo” para anexar um conjunto exclusivo de caracteres ao nome do bucket que for criado.
  3. No campo Nome do arquivo, especifique um nome para o arquivo no qual deseja gravar.
  4. Escolha uma das três opções em “Se o arquivo existir ”: “Não sobrescrever o arquivo”, “Falha” ou “Sobrescrever o arquivo”.
  5. Na seção " Wavehandling ", você pode selecionar a opção "Anexar identificador único". Use essa opção para definir se um identificador exclusivo deve ser acrescentado ao nome do arquivo. Quando definido como Sim:
    • O nome do arquivo recebe um identificador único, e um novo arquivo é gravado para cada lote de dados transmitido para o estágio.
    • A opção “Limite de tamanho do arquivo” está ativada. Especifique o limite para o tamanho do arquivo em megabytes. Os nós de processamento criarão um novo arquivo sempre que o tamanho exceder o valor especificado.
    Quando definido como “Não”, o arquivo é sobrescrito a cada onda.
  6. Nos atributos do arquivo, você pode:
    • Especifique os metadados do usuário em uma lista de pares nome-valor, por exemplo Topic=News. Separe cada par nome-valor com um ponto-e-vírgula, por exemplo Topic=Music;SubTopic=Pop.
    • Escolha uma das três opções em "Criptografia no lado do servidor ": "Nenhuma", " AES-256 " ou " AWS KMS".
    • Escolha a classe de armazenamento para o arquivo: a de redundância reduzida ou a Padrão.
    • Especifique o tipo de conteúdo do arquivo a ser gravado. Por exemplo, text/xml ou charset=utf-8.
    • Defina a opção “Definir regras de ciclo de vida” como “Sim”. Em seguida, você pode escolher o escopo da regra para apenas o arquivo ou para os arquivos na pasta, e o formato do período de tempo para especificar se a regra de ciclo de vida se baseia no número de dias (dias a partir da data de criação) ou em uma data específica. Você pode definir a opção "Expirar " como "Sim" e especificar o número de dias durante os quais o arquivo permanecerá disponível. Você pode definir a opção Arquivar como Sim para indicar se deseja arquivar o arquivo no Amazon Glacier e especificar a data do arquivamento.
    • Especifique a quantidade de dados em MB que o conector grava no ` Amazon S3 ` antes de enviar uma mensagem de progresso para o log da tarefa em “Intervalo para mensagens de progresso ”.
    • Especifique o número de gravadores paralelos.
    • Especifique o tamanho máximo da pilha da Máquina Virtual Java em megabytes.

Configure o processo de gravação para um conector d Amazon S3 e ao desmarcar a opção “Usar propriedades d DataStage ”.

Tabela 4. Gravar dados no Amazon S3 com a opção "Usar propriedades DataStage " desmarcada
Modo de Gravação Procedimento
Excluir um arquivo
  1. Especifique o nome do bucket que contém os arquivos.
  2. Na ação Tabela, escolha uma das três opções: Anexar, Substituir ou Truncar.
  3. No campo Nome do arquivo, especifique o nome do arquivo a ser excluído.
Gravar em um arquivo
  1. Especifique o nome do bucket que contém os arquivos ou selecione Criar bucket.
  2. Na ação Tabela, escolha uma das três opções: Anexar, Substituir ou Truncar.
  3. No formato da tabela, escolha uma das três opções: Deltalake, Arquivo simples ou Iceberg. Se você selecionar “Arquivo simples”, a opção “Particionado” ficará disponível, o que grava o arquivo com várias partições.
  4. No campo Nome do arquivo, especifique um nome para o arquivo no qual deseja gravar.
Gravar dados binários
  1. Especifique o nome do bucket que contém os arquivos ou selecione Criar bucket.
  2. Na ação Tabela, escolha uma das três opções: Anexar, Substituir ou Truncar.
  3. No campo Nome do arquivo, especifique um nome para o arquivo no qual deseja gravar.