IBM watsonx.data Presto conexão

Para acessar seus dados em IBM watsonx.data, crie um ativo de conexão para ele. O ativo de conexão inclui informações para conexão com uma instância watsonx.data e com o mecanismo de consulta Presto que está sendo executado nessa instância.

IBM watsonx.data é um data lakehouse aberto, híbrido e governado que é um mecanismo de consulta otimizado para todas as cargas de trabalho de dados e IA.

Antes de iniciar

Diferenças entre as conexões watsonx.data Presto e Presto

IBM watsonx.data incorpora o Presto SQL Query Engine. Tanto as conexões watsonx.data Presto e Presto podem criar ativos de conexão para interagir com o Presto SQL Query Engine no IBM watsonx.data.

IBM watsonx.data Presto conexão

A conexão IBM watsonx.data Presto permite a leitura de IBM watsonx.data utilizando o mecanismo Presto SQL Query. Ele também oferece suporte à gravação de tabelas nos formatos Iceberg e Delta Lake nos seguintes sistemas de armazenamento:

  • Amazon S3
  • Amazon S3 com pontos de acesso multirregionais
  • Apache Ozone
  • Google Cloud Storage
  • IBM Céfalo
  • IBM Cloud Object Storage
  • IBM Storage Scale
  • MinIO
  • S3 personalizado

Além disso, com a conexão IBM watsonx.data Presto, é possível gravar tabelas do Iceberg no Data Lake Storage Azure. A conexão suporta vários modos de gravação, incluindo atualização e mesclagem, bem como a execução de instruções UPDATE. Todas as operações de gravação são executadas por meio do mecanismo de armazenamento em banco de dados ( Presto ). A conexão também oferece um modo de gravação de ingestão, que permite gravar dados diretamente em sistemas de armazenamento compatíveis, ao mesmo tempo em que registra automaticamente as tabelas Iceberg e Delta no Serviço de Metadados (MDS) no IBM watsonx.data. Essa conexão também é necessária para habilitar a integração com o IBM watsonx.data intelligence, permitindo que você aproveite ao máximo os recursos de inteligência, como mascaramento de dados e proteção por regras, no IBM watsonx.data.

IBM recomenda o uso da conexão watsonx.data Presto ao se conectar de Cloud Pak for Data a IBM watsonx.data.

Para obter mais informações sobre a conexão watsonx.data Presto, consulte o restante do tópico.

Presto

A conexão Presto oferece uma maneira genérica de se conectar a qualquer mecanismo Presto, incluindo a implementação disponível em IBMwatsonx.data. Ele suporta os modos de gravação insert, update e merge, bem como a execução de instruções UPDATE, mas apenas no contexto das tabelas Iceberg. Assim como na conexão com o watsonx.data-specific, todas as operações de gravação são executadas por meio do mecanismo Presto. No entanto, essa conexão não oferece integração total com IBM watsonx.data intelligence.

Pré-requisito

Configure uma instância de watsonx.data

Você pode se conectar a instâncias de software ou como serviço:

Crie uma conexão com watsonx.data

Os detalhes de sua conexão variam de acordo com o tipo de implantação escolhido. Para criar o ativo de conexão, na seção Detalhes de conexão da página Conectar-se a uma fonte de dados, selecione o tipo de implantação:

  • Edição IBM watsonx.data Developer
  • IBM watsonx.data as a Service
  • IBM watsonx.data no Red Hat OpenShift

Também é possível deixar o tipo de implantação no valor padrão, onde você vê os detalhes da conexão herdada.

Os detalhes que você precisa fornecer mudarão de acordo com o tipo de implantação que você escolher:

Edição IBM watsonx.data Developer

Você pode importar um arquivo JSON para preencher esses campos usando a opção Importar valores de conexão. Para obter o arquivo JSON necessário para essa conexão, acesse a página do console da instância watsonx.data, navegue até o campo Connect information (Informações de conexão) e copie o arquivo JSON.

  • Nome do host ou endereço IP: Encontre essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • Porta: o número da porta padrão é 443 Você pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • ID da instância: Encontre esse valor no console watsonx.data. Clique Detalhes da instância no menu de navegação. Você também pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • Suporte a instruções preparadas : habilite esta opção se desejar permitir instruções preparadas para o conector.

IBM watsonx.data as a Service

Você pode importar um arquivo JSON para preencher esses campos usando a opção Importar valores de conexão. Para obter o arquivo JSON necessário para essa conexão, acesse a página do console da instância watsonx.data, navegue até o campo Connect information (Informações de conexão) e copie o arquivo JSON.

  • Nome do host ou endereço IP: Encontre essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • Porta: o número da porta padrão é 443 Você pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • CRN: Nome do recurso de nuvem: encontre esse valor no console watsonx.data. Clique Detalhes da instância no menu de navegação. Você também pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • Suporte a instruções preparadas : habilite esta opção se desejar permitir instruções preparadas para o conector.

IBM watsonx.data no Red Hat OpenShift

Você pode importar um arquivo JSON para preencher esses campos usando a opção Importar valores de conexão. Para obter o arquivo JSON necessário para essa conexão, acesse a página do console da instância watsonx.data, navegue até o campo Connect information (Informações de conexão) e copie o arquivo JSON.

  • Nome do host ou endereço IP: Encontre essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • Porta: o número da porta padrão é 443 Você pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • ID da instância: Encontre esse valor no console watsonx.data. Clique Detalhes da instância no menu de navegação. Você também pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • Suporte a instruções preparadas : habilite esta opção se desejar permitir instruções preparadas para o conector.

Detalhes da conexão herdada

watsonx.data software

Para criar o ativo de conexão, na seção Detalhes de conexão da página Conectar a uma fonte de dados, selecione Conectar a watsonx.data em Cloud Pak for Data e forneça esses detalhes:

  • Nome do host ou endereço IP: Encontre essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • Porta: o número da porta padrão é 443 Você pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • ID da instância: Encontre esse valor no console watsonx.data. Clique Detalhes da instância no menu de navegação. Você também pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.
  • Nome da instância: Localize o nome da instância na página inicial do cliente Web do Cloud Pak for Data. Clique em Serviços > Instâncias no menu de navegação.
  • Suporte a instruções preparadas : habilite esta opção se desejar permitir instruções preparadas para o conector.
watsonx.data como um serviço
  • Nome do host ou endereço IP: Encontre essas informações no console em Configurações > Informações de conexão > Detalhes da instância.

  • Porta: o número da porta padrão é 443 Você pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.

  • ID da instância: Encontre esse valor no console watsonx.data. Clique Detalhes da instância no menu de navegação. Você também pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.

  • Nome da instância: Encontre este valor no watsonx.ai Instâncias de serviço página. Clique Administração > Serviços > Instâncias de serviço. Por exemplo, watsonx.data-aaa. Não use o nome de instância sugerido mostrado no campo.

  • CRN: Nome do recurso de nuvem: encontre esse valor no console watsonx.data. Clique Detalhes da instância no menu de navegação. Você também pode encontrar essas informações no console em Configurações > Informações de conexão > Detalhes da instância.

  • Suporte a instruções preparadas : habilite esta opção se desejar permitir instruções preparadas para o conector.

Credenciais

Suas credenciais variam de acordo com o tipo de implantação escolhido:

  • Edição IBM watsonx.data Developer
  • IBM watsonx.data as a Service
  • IBM watsonx.data no Red Hat OpenShift

Também é possível deixar o tipo de implantação no valor padrão, onde você vê os detalhes da conexão herdada.

Edição IBM watsonx.data Developer

  • Nome de usuário e senha : o nome de usuário e a senha usados para fazer login no console autônomo watsonx.data.

IBM watsonx.data as a Service

  • Chave API : A chave API da conta que tem acesso à instância watsonx.data.

Para criar uma chave de API, consulte Criando uma chave de API no console.
Para criar uma chave API do Amazon Web Services, consulte Criando chaves API.

IBM watsonx.data no Red Hat OpenShift

Selecione um método de autenticação:

  • Nome de usuário e senha: o nome de usuário e a senha usados para acessar o Cloud Pak for Data, onde a instância watsonx.data está localizada.
  • Nome de usuário e chave de API: o nome de usuário e a chave de API que são usados para acessar o Cloud Pak for Data, onde a instância watsonx.data está localizada.

Este método de autenticação é recomendado se Cloud Pak for Data utilizar um Serviço de Gerenciamento de Identidade (IAM), por exemplo, LDAP ou SSO. A chave API está localizada em Perfil e configurações do cluster Cloud Pak for Data de destino. Para obter informações sobre chaves de API, consulte Geração de chaves de API para autenticação.

Detalhes da conexão herdada

watsonx.data software

O nome de usuário e a senha ou os nomes de usuário e a chave de API da instância watsonx.data. As mesmas credenciais também são usadas para o motor.

Selecione o método de autenticação:

  • Nome de usuário e senha: o nome de usuário e a senha usados para acessar o Cloud Pak for Data, onde a instância watsonx.data está localizada, ou o nome de usuário e a senha para o watsonx.data autônomo.
  • Nome de usuário e chave de API: o nome de usuário e a chave de API que são usados para acessar o Cloud Pak for Data, onde a instância watsonx.data está localizada, ou o nome de usuário e a senha para watsonx.data autônomo. Este método de autenticação é recomendado se Cloud Pak for Data utilizar um Serviço de Gerenciamento de Identidade (IAM), por exemplo, LDAP ou SSO. A chave API está localizada em Perfil e configurações do cluster Cloud Pak for Data de destino. Para obter informações sobre chaves de API, consulte Geração de chaves de API para autenticação.
watsonx.data como um serviço

O nome de usuário e a senha da instância watsonx.data. As mesmas credenciais também são usadas para o motor.

  • Username: o nome de usuário padrão é ibmlhapikey_<cloud-account-email-address>. Por exemplo, ibmlhapikey_username@example.com.
  • Password: a senha é a chave de API do usuário. Para criar uma chave API, consulte a documentação do IBM Cloud : Criando uma chave API no console.
    Para criar uma chave API do Amazon Web Services, consulte Criando chaves API.

Certificados

Por padrão, a opção “ SSL ” (Aplicar alterações de configuração no próximo logon) está selecionada. Essa configuração é recomendada para aumentar a segurança Se você não usar SSL, os dados podem estar sujeitos a vulnerabilidades, como vazamento de dados. Embora o banco de dados hospedado em watsonx.data também possa ter um certificado SSL, a conexão passa pelo mecanismo.

O certificado SSL deve estar no formato PEM.

As informações dos certificados SSL variam de acordo com o tipo de implantação escolhido:

  • Edição IBM watsonx.data Developer
  • IBM watsonx.data as a Service
  • IBM watsonx.data no Red Hat OpenShift

Edição IBM watsonx.data Developer

O certificado SSL é opcional.

Se a opção “ SSL ” estiver ativada em uma instância do watsonx.data no Cloud Pak for Data e o certificado for um certificado autoassinado, você deverá inserir o certificado no campo “ SSL ”.

Pergunte ao seu administrador watsonx.data se o SSL está configurado. Você pode encontrar o certificado SSL no console watsonx.data em Configurações > Informações de conexão > Detalhes da instância.

IBM watsonx.data as a Service

O certificado SSL é opcional.

IBM watsonx.data no Red Hat OpenShift

O certificado SSL é opcional.

Se a opção “ SSL ” estiver ativada em uma instância do watsonx.data no Cloud Pak for Data e o certificado for um certificado autoassinado, você deverá inserir o certificado no campo “ SSL ”.

Pergunte ao seu administrador watsonx.data se o SSL está configurado. Você pode encontrar o certificado SSL no console watsonx.data em Configurações > Informações de conexão > Detalhes da instância.

Detalhes da conexão do mecanismo

Importante: os detalhes da conexão do mecanismo estão obsoletos, mas você ainda pode adicionar e atualizar os detalhes da conexão do mecanismo. No entanto, isso será descontinuado no futuro.

Insira os detalhes da conexão do motor

Versões do mecanismo compatíveis

Para watsonx.data no Cloud Pak for Data versão 5.0.3 e posterior:

  • Presto (Java)
  • Presto (C++)

Para watsonx.data em Cloud Pak for Data versão 5.0.2 e anteriores:

  • Presto (Java)

Para watsonx.data como um serviço:

  • Presto (Java)
  • Presto (C++)

Forneça esses detalhes de conexão do motor. Encontre essas informações no console da Web watsonx.data em Configurações > Informações de conexão > Detalhes de conexão do mecanismo e do serviço.

  • Nome de host ou endereço IP do mecanismo: O nome do host ou endereço IP é o valor do Host interno campo.

  • ID do mecanismo: Este valor está no ID do mecanismo campo.

  • Porto do motor: O número da porta é o valor no Host interno campo após os dois pontos (: ). O número da porta padrão é8443 .

Gravando dados em watsonx.data

Você pode importar dados para o watsonx.data usando o conector IBM watsonx.data Presto. Você deve inserir um catalog_name, schema_name e table_name properties. A propriedade table_name é obrigatória. Você pode passar o nome totalmente qualificado, catalog_name.schema_name.table_name, para a table_name propriedade.

O conector watsonx.data Presto cria tabelas Iceberg e tabelas Delta Lake diretamente no armazenamento definido em IBM watsonx.data.

Atualmente, o conector suporta a gravação no seguinte armazenamento:

  • Amazon S3
  • Apache Ozone
  • Google Cloud Storage
  • IBM Céfalo
  • IBM Cloud Object Storage
  • IBM Storage Scale
  • MinIO

Gravação no seguinte armazenamento apenas para tabelas Iceberg:

  • Azure Data Lake Storage

O mecanismo de gravação em massa ( Presto ) é utilizado apenas nos modos de gravação de atualização ou mesclagem.

Ações da tabela

Você pode usar o conector IBM watsonx.data Presto para ingerir dados em IBM watsonx.data. Os dados podem ser gravados no formato de tabela Iceberg ou no formato de tabela Delta Lake.

Usando ações de tabela, você pode especificar a operação que deseja fazer com a tabela Iceberg ou a tabela Delta Lake.

As ações da tabela a seguir são compatíveis:

Append
O conector criará uma nova tabela Iceberg ou Delta Lake, ou anexará dados à tabela existente.
Create
O conector criará uma nova tabela Iceberg ou Delta Lake. Ao usar essa ação na tabela existente, você recebe um erro.
Replace
O conector substitui o conteúdo da tabela Iceberg ou Delta Lake por novos dados. O esquema e os metadados da tabela também podem ser alterados.
Truncate
O conector remove logicamente os dados da tabela existente e adiciona novas linhas de dados. Essa ação não pode alterar a definição da coluna da tabela.

Modos de gravação

Em uma conexão IBM, watsonx.data ou Presto, você pode usar os seguintes modos de gravação:

Ingest
Carrega registros diretamente em uma tabela no armazenamento e registra a tabela no metastore do watsonx.data. O mecanismo “ Presto ” não é utilizado nesta operação.
Update
Modifica registros existentes com base nas colunas especificadas na key_column_names propriedade. Somente os registros que correspondem às chaves fornecidas são atualizados.
Merge
Combina operações de inserção e atualização. Ele atualiza os registros existentes e insere novos com base nas colunas de key_column_names.
Update statement
Uma instrução SQL personalizada inserida manualmente pelo usuário. Pode incluir qualquer operação, como INSERT, UPDATE, MERGE, ou DELETE.
Update statement with table action
Uma instrução SQL personalizada inserida manualmente pelo usuário, precedida por uma ação de tabela. Pode incluir qualquer operação, como INSERT, UPDATE, MERGE, ou DELETE.
Static statement
Qualquer instrução SQL executada sem restrições quanto ao tipo ou à finalidade.

Console da web watsonx.data

Limitação

  • A conexão watsonx.data Presto não é compatível com os tipos de dados TIME e TIMESTAMP quando o mecanismo Presto C++ é usado.

  • A conexão do watsonx.data Presto não suporta TIME os tipos de dados e TIMESTAMP ao ler tabelas do Data Lake.

  • A conexão watsonx.data Presto não é compatível com a conexão com watsonx.data como um serviço em Sydney se watsonx.data como um serviço usar apenas pontos de extremidade privados

  • A conexão watsonx.data Presto não é compatível com a gravação em watsonx.data como um serviço em Toronto se watsonx.data como um serviço usar apenas pontos de extremidade privados.

  • A watsonx.dataPresto conexão não suporta a gravação Delta Lake de tabelas no Azure Data Lake Storage.

  • A conexão watsonx.data Presto suporta operações de atualização e mesclagem apenas para tabelas do Iceberg.

  • O mecanismo C++ do watsonx.data Presto não oferece suporte a operações de atualização e mesclagem.

  • As tabelas do Iceberg não suportam gravações simultâneas. Para mitigar isso, o conector repete as operações de atualização e mesclagem conflitantes até três vezes. Se os conflitos persistirem, execute as tarefas sequencialmente.

  • Se o suporte à instrução Prepare estiver habilitado e uma consulta longa for enviada ao Presto mecanismo por meio do conector, poderá ocorrer o seguinte erro:

    SQL statement failed. Network closed for unknown reason
    

Saiba Mais

Conexões relacionadas