Use o conector Amazon S3 no DataStage® para se conectar ao Amazon Simple Storage Service ( S3 ) e executar várias funções de leitura e gravação.
DataStage propriedades
Na seção Propriedades da guia Palco, selecione Usar propriedades do DataStage para acessar as propriedades específicas do DataStage. Essas propriedades fornecem mais recursos e controle granular da execução do fluxo, semelhantes aos conectores "otimizados".
Se você selecionar “Usar propriedades do DataStage ” com um arquivo. CSV, os valores das colunas devem estar entre aspas duplas. Se for necessário fazer alguma personalização, use as propriedades de formato de arquivo do conector para alterar o formato do arquivo para "Delimitado". Em seguida, selecione o delimitador de campo, o delimitador de linha, o caractere de aspas e o caractere de escape.
Limpe as propriedades " DataStage " para acessar as opções da propriedade "Formato da tabela".
Se você selecionar “Usar propriedades do DataStage ”, utilize o endpoint correto URL ao acessar o bucket. Se você quiser acessar o bucket em uma região diferente, não utilize o endpoint URL. O acesso entre regiões não é compatível quando são fornecidos pontos de extremidade.
Para o desenvolvimento de novos fluxos, utilize a abordagem do conector de plataforma. Quando a opção “Usar propriedades do DataStage ” está desativada, o DataStage utiliza o conector de última geração recomendado. Ao usar o conector da plataforma, configure a autenticação por token de sessão diretamente nas propriedades da conexão. Os tokens de sessão não são compatíveis quando a opção “Usar propriedades d DataStage ” está ativada.
Configurando o conector do Amazon S3 como fonte
As propriedades disponíveis para o modo de leitura dependem da seleção da opção “Usar propriedades d DataStage ”.
Configure o processo de leitura para um conector d
Amazon S3 e ao selecionar “
Usar propriedades d DataStage ” (padrão).
Tabela 1. Lendo dados de Amazon S3 com a opção "Usar propriedades do DataStage " selecionada
| Modo de leitura |
Procedimento |
| Ler um arquivo único |
Especifique o nome do bucket que contém o arquivo e, em seguida, especifique o nome do arquivo a ser lido. |
| Ler diversos arquivos |
- Especifique o nome do bucket que contém os arquivos.
- No campo " Nome do arquivo", especifique um prefixo que os arquivos que você deseja ler devem ter em seu caminho de arquivo.
Por exemplo, se você inserir transactions como prefixo, o conector lê todos os arquivos na transactions pasta, como transactions/january/day1.txt, e um arquivo chamado transactions.txt.
|
| Listar depósitos |
Nenhuma configuração adicional é necessária. |
| Listar arquivos |
- Especifique o nome do bucket que contém os arquivos.
Opcional: No campo Nome do arquivo, especifique um prefixo que os arquivos que você deseja ler devem ter em seu caminho.
Por exemplo, se você digitar transactions como prefixo, o conector listará todos os arquivos na transactions pasta, como transactions/january/day1.txt, e um arquivo chamado transactions.txt.
Se você não especificar um prefixo para o nome do arquivo, todos os arquivos no contêiner do bucket serão listados.
|
Configure o processo de leitura para um conector do Amazon S3 e ao desmarcar a opção “Usar o DataStage ” nas propriedades.
Tabela 2. Lendo dados de um arquivo ` Amazon S3 ` com a opção "Usar propriedades do ` DataStage `" desmarcada
| Modo de leitura |
Procedimento |
| Ler um arquivo único |
Especifique o nome do bucket que contém o arquivo e, em seguida, especifique o nome do arquivo a ser lido. |
| Ler dados binários |
Especifique o nome do bucket que contém o arquivo e, em seguida, especifique o nome do arquivo a ser lido. |
| Leia dados binários de vários arquivos usando caracteres curinga |
Especifique um caractere curinga no nome do arquivo para dados binários. Por exemplo, no campo “Nome do arquivo”, digite test.*.gz. Se você usar essa opção, poderá ler vários arquivos binários, um após o outro, e cada arquivo será lido como um registro.
Se você selecionar “Ler um arquivo em uma linha ”, deverá fornecer dois nomes de colunas na guia “Saída” do estágio de origem:
- A primeira coluna deve ser do tipo de dados string. Esta coluna é destinada ao nome do arquivo.
- A segunda coluna deve ser do tipo de dados binário. Esta coluna é para arquivo. O valor da precisão da coluna binária deve ser maior ou igual ao tamanho máximo do arquivo.
|
| Ler vários arquivos usando expressões regulares |
Especifique o nome do bucket que contém os arquivos. Você pode usar uma expressão regular Java para o nome do arquivo. Exemplos:
^csv_write_datatypes_h.[0-9]$
csv_write_datatypes_h.[^12]
|
| Leia vários arquivos usando caracteres curinga |
Especifique um asterisco (*) para corresponder a zero ou mais caracteres. Por exemplo, especifique *.txt para localizar todos os arquivos com a extensão.txt. Use um ponto de interrogação (?) para corresponder a um caractere.
Exemplos:
csv_write_datatypes.*
?_abc_test*
|
Configurando o conector do Amazon S3 como destino
As propriedades disponíveis para o modo de gravação dependem da seleção da opção “Usar propriedades d DataStage ”.
Configure o processo de gravação para um conector d
Amazon S3 e ao selecionar “
Usar propriedades d DataStage ” (padrão).
Tabela 3. Gravar dados em um arquivo ` Amazon S3 ` com a opção "Usar propriedades de ` DataStage `" selecionada
| Modo de Gravação |
Procedimento |
| Excluir um arquivo |
- Especifique o nome do bucket que contém os arquivos ou selecione Criar bucket.
- No campo Nome do arquivo, especifique o nome do arquivo a ser excluído.
|
| Gravar em um arquivo |
- Especifique o nome do bucket que contém os arquivos.
- Se você deseja criar um bucket que contenha os arquivos a serem gravados, defina a opção “Criar bucket” como “Sim”. Em seguida, você pode selecionar a opção “Anexar ID exclusivo” para anexar um conjunto exclusivo de caracteres ao nome do bucket que for criado.
- No campo Nome do arquivo, especifique um nome para o arquivo no qual deseja gravar.
- Escolha uma das três opções em “Se o arquivo existir ”: “Não sobrescrever o arquivo”, “Falha” ou “Sobrescrever o arquivo”.
- Na seção " Wavehandling ", você pode selecionar a opção "Anexar identificador único". Use essa opção para definir se um identificador exclusivo deve ser acrescentado ao nome do arquivo. Quando definido como Sim:
- O nome do arquivo recebe um identificador único, e um novo arquivo é gravado para cada lote de dados transmitido para o estágio.
- A opção “Limite de tamanho do arquivo” está ativada. Especifique o limite para o tamanho do arquivo em megabytes. Os nós de processamento criarão um novo arquivo sempre que o tamanho exceder o valor especificado.
Quando definido como “Não”, o arquivo é sobrescrito a cada onda.
- Nos atributos do arquivo, você pode:
- Especifique os metadados do usuário em uma lista de pares nome-valor, por exemplo Topic=News. Separe cada par nome-valor com um ponto-e-vírgula, por exemplo Topic=Music;SubTopic=Pop.
- Escolha uma das três opções em "Criptografia no lado do servidor ": "Nenhuma", " AES-256 " ou " AWS KMS".
- Escolha a classe de armazenamento para o arquivo: a de redundância reduzida ou a Padrão.
- Especifique o tipo de conteúdo do arquivo a ser gravado. Por exemplo, text/xml ou charset=utf-8.
- Defina a opção “Definir regras de ciclo de vida” como “Sim”. Em seguida, você pode escolher o escopo da regra para apenas o arquivo ou para os arquivos na pasta, e o formato do período de tempo para especificar se a regra de ciclo de vida se baseia no número de dias (dias a partir da data de criação) ou em uma data específica. Você pode definir a opção "Expirar " como "Sim" e especificar o número de dias durante os quais o arquivo permanecerá disponível. Você pode definir a opção Arquivar como Sim para indicar se deseja arquivar o arquivo no Amazon Glacier e especificar a data do arquivamento.
- Especifique a quantidade de dados em MB que o conector grava no ` Amazon S3 ` antes de enviar uma mensagem de progresso para o log da tarefa em “Intervalo para mensagens de progresso ”.
- Especifique o número de gravadores paralelos.
- Especifique o tamanho máximo da pilha da Máquina Virtual Java em megabytes.
|
Configure o processo de gravação para um conector d Amazon S3 e ao desmarcar a opção “Usar propriedades d DataStage ”.
Tabela 4. Gravar dados no Amazon S3 com a opção "Usar propriedades DataStage " desmarcada
| Modo de Gravação |
Procedimento |
| Excluir um arquivo |
- Especifique o nome do bucket que contém os arquivos.
- Na ação Tabela, escolha uma das três opções: Anexar, Substituir ou Truncar.
- No campo Nome do arquivo, especifique o nome do arquivo a ser excluído.
|
| Gravar em um arquivo |
- Especifique o nome do bucket que contém os arquivos ou selecione Criar bucket.
- Na ação Tabela, escolha uma das três opções: Anexar, Substituir ou Truncar.
- No formato da tabela, escolha uma das três opções: Deltalake, Arquivo simples ou Iceberg. Se você selecionar “Arquivo simples”, a opção “Particionado” ficará disponível, o que grava o arquivo com várias partições.
- No campo Nome do arquivo, especifique um nome para o arquivo no qual deseja gravar.
|
| Gravar dados binários |
- Especifique o nome do bucket que contém os arquivos ou selecione Criar bucket.
- Na ação Tabela, escolha uma das três opções: Anexar, Substituir ou Truncar.
- No campo Nome do arquivo, especifique um nome para o arquivo no qual deseja gravar.
|