Fontes de dados compatíveis com a Data Virtualization

Data Virtualization oferece suporte às seguintes fontes de dados relacionais e não relacionais em ' IBM Cloud Pak for Data as a Service.

Você não pode se conectar a uma fonte de dados como uma conexão a uma conexão de Plataforma Existente se a conexão da Plataforma utilizar a integração Cloud, Secure Gatewayou Satellite Link. Esses recursos não são compatíveis com a Data Virtualization quando você se conecta às conexões da plataforma. Você vê uma mensagem de erro que é semelhante aCannot reach the network destination of the data source. Você pode configurar a fonte de dados usando a integração com a nuvem, o Secure Gateway ou o Satellite Link e fornecer o nome do host ou o ponto de extremidade de IP diretamente à Data Virtualization como uma nova conexão.

Limites de tamanho
Data Virtualization oferece suporte à virtualização de tabelas com um tamanho de linha de até 1 MB e até 2048 colunas em uma tabela. No entanto, o número de colunas que Data Virtualization pode visualizar depende de muitos fatores, como os tipos de dados das colunas. Atualmente, a visualização é limitada a 200 colunas.
Atributos de comentário
Quando tabelas virtuais são criadas, Data Virtualization não inclui atributos de comentários que foram atribuídos a objetos de fonte de dados. Essa limitação aplica-se a todas as origens de dados.
Tipos de dados
Alguns tipos de dados em sua fonte de dados podem não ser compatíveis com a Data Virtualization. Essas limitações estão documentadas nas tabelas a seguir. Data Virtualization também pode mapear alguns tipos de dados em sua fonte de dados para tipos de dados alternativos. Esses mapeamentos são baseados nos mapeamentos subjacentes do Db2® Big SQL . Para obter mais informações, consulte Tipos de dados no Db2 Big SQL.

Origens de dados da IBM

A tabela a seguir lista as fontes de dados IBM® às quais você pode se conectar a partir da Data Virtualization.

Tabela 1. Fontes de dados IBM suportadas
Conector Limitações Mais informações
IBM Cloud Databases for MongoDB O IBM Cloud Databases for MongoDB está disponível como beta.

Os seguintes tipos de dados ' MongoDB são compatíveis com a Data Virtualization: INT32, INT64, DOUBLE, STRING, BOOLEAN, DATE e BINARY.

 
IBM Cloud Databases for MySQL    
IBM Cloud Bancos de Dados para PostgreSQL  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

IBM Cloud Object Storage

Essa conexão requer consideração especial na Data Virtualization. Consulte Conexão com o IBM Cloud Object Storage na Data Virtualization.

Para obter limitações, consulte Fontes de dados em armazenamento de objetos na Data Virtualization.

 
IBM Data Virtualization Manager for z/OS Não será possível se conectar ao Data Virtualization Manager for z/OS se a conexão usar a integração de nuvem, Secure Gatewayou Satellite Link. Esses recursos não são compatíveis com a Data Virtualization. Você verá uma mensagem de erro que é semelhante aCannot reach the network destination of the data source.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

IBM Db2
  • Os tipos NCHAR e NVARCHAR não são compatíveis com a Data Virtualization.
  • Db2 usa um tipo DECFLOAT, cujo padrão da Data Virtualization é DOUBLE. Esse mapeamento influencia como os valores específicos são retornados.
  • Db2 usam tipos DISTINCT, cujo padrão Data Virtualization é BLOB.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

IBM Db2 Big SQL  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

IBM Db2 for i  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

IBM Db2 for z/OS  
IBM Db2 on Cloud Os tipos NCHAR e NVARCHAR não são compatíveis com a Data Virtualization.  
IBM Db2 Warehouse    
IBM Informix® Os tipos de dados INTERVAL, BIGINT e BIGSERIAL não são compatíveis com a Data Virtualization. Para obter mais informações, consulte Ocorrem exceções ao usar o driver do Connect for JDBC Informix.
IBM Netezza Performance Server
  • Os tipos de dados BLOB, XML e CLOB ' Netezza não são compatíveis com a Data Virtualization.
  • Quando você usa uma instrução SELECT ou visualiza dados LOB maiores que 64 kB, Data Virtualization de Dados trunca os dados para apenas 64 K bytes.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

IBM Planning Analytics
  • Data Virtualization pode virtualizar apenas visualizações TM1® com uma dimensão de coluna.
  • A agregação não pode ser empurrada para baixo para TM1. Se uma consulta com relação ao TM1 contiver uma operação de agregação como COUNT, SUM, AVG, MAX, MIN ou GROUP BY, será possível incluir a opção do servidor a seguir.
    alter server qplex options (add DB2_GROUP_BY 'N') 
  • Data Virtualization é compatível apenas com os tipos de dados VARCHAR e DOUBLE no TM1.
  • TM1 não reconhece SQL. A linguagem de consulta nativa do TM1 é o MDX, que não tem o conceito de pushdown. Portanto, essa origem de dados não está configurada para suportar o pushdown ideal do predicado.
 
IBM Data Virtualization
Importante: Não crie uma conexão com sua instância de Data Virtualization.
 

Origens de dados de terceiros

A tabela a seguir lista as fontes de dados de terceiros às quais você pode se conectar a partir da Data Virtualization.

Tabela 2. Fontes de dados de terceiros suportados
Conector Limitações Mais informações
Amazon RDS for MySQL
  • Você deve criar apenas uma conexão com um banco de dados em uma origem de dados MySQL para evitar linhas duplicadas na página Virtualizar . O MySQL não suporta o isolamento do banco de dados
  • Os tipos de BIT não são compatíveis com a Data Virtualization.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Amazon RDS for Oracle
  • Quando você usa uma instrução SELECT ou visualiza dados LOB maiores que 64 kB, Data Virtualization de Dados trunca os dados para apenas 64 K bytes.
  • Os seguintes tipos de dados são convertidos na Data Virtualization:
    • INTERVAL e JSON convertem em VARCHAR.
    • Os tipos de caracteres nacionais convertem em CHAR, VARCHAR ou CLOB.
    • TIMESTAMP e TIMESTAMP WITH LOCAL TIME ZONE convertem em TIMESTAMP.
    • XML converte em CLOB.
    • SMALLINT, INTEGER, BIGINT converter para DECIMAL 4.0, DECIMAL 9.0e DECIMAL 18.0.
    • SMALLINT, INTEGER, BIGINT converter para DECIMAL 4.0, DECIMAL 9.0e DECIMAL 18.0.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Amazon RDS for PostgreSQL  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Amazon Redshift Os tipos de dados SPATIAL, SKETCH e SUPER são convertidos para CLOB em Data Virtualization.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Amazon S3

Essa conexão requer consideração especial na Data Virtualization. Consulte Conexão com Amazon S3 em Data Virtualization.

  • Regras específicas se aplicam para nomenclatura de depósitos no Amazon S3. Para obter mais informações, consulte Regras de nomenclatura de buckets na documentação do site Amazon S3 .
  • Se você incluir pontos no nome de um depósito, não será possível usar endereçamento de estilo host virtual sobre HTTPS, a menos que você realize sua própria validação de certificado. Os certificados de segurança que são usados para hospedagem virtual de depósitos não funcionam para depósitos com pontos nos nomes.
  • Com o serviço " AWS PrivateLink " Amazon S3, você pode provisionar pontos de extremidade de interface da VPC (interface endpoints) na sua nuvem privada virtual (VPC). Não é possível usar esses pontos de extremidade no URL de pontos de extremidade ao criar uma conexão com uma fonte Amazon S3 de dados. Esse tipo de terminal não é suportado. Você deve usar o terminal padrão para Amazon S3, por exemplo, http://s3.eu-central-1.amazonaws.com/.
  • Para obter mais limitações, consulte Fontes de dados no armazenamento de objetos em Data Virtualization.
 
Apache Derby  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Apache Hive
  • Em tabelas virtualizadas, é possível listar somente o valor de tipos de dados complexos, como matriz, mapa,estrutura e tipo de união. Qualquer outra operação sobre o valor desses tipos de dados complexos não ésuportada.
  • Quando você usa uma instrução SELECT ou visualiza dados LOB maiores que 64 kB, Data Virtualization de Dados trunca os dados para apenas 64 K bytes.
  • Os tipos sequência e binário em origens de dados Hive agora são resolvidos para VARCHAR(32672) e VARBINARY(32672) por padrão, em vez de CLOB e BLOB. Um administrador Data Virtualization pode configurar " HIVE_MAX_STRING_SIZE e " HIVE_MAX_BINARY_SIZE. Esta atualização otimiza o desempenho SQL para origens de dados do Hive. Um administrador Data Virtualization pode configurar " HIVE_MAX_STRING_SIZE e " HIVE_MAX_BINARY_SIZE chamando o procedimento " DVSYS.SETCONFIGPROPERTY.

    Por exemplo, para mudar o tamanho máximo padrão para o tipo de dados Hive BINARY para 2000, que é resolvido para VARBINARY(2000), execute o comando a seguir.

    db2 "call dvsys.setconfigproperty ('HIVE_MAX_BINARY_SIZE', '2000', '', ?, ?)"

    O tamanho mínimo é 1 e o tamanho máximo recomendado é 32672. É possível exceder 32672; no entanto, os tipos STRING e BINARY serão resolvidos para os tipos CLOB e BLOB, o que pode fazer certas consultas falharem.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Ceph

Essa conexão requer consideração especial na Data Virtualization. Consulte Conexão com o Ceph em Data Virtualization.

Para obter limitações, consulte Fontes de dados no armazenamento de objetos em Data Virtualization.

 
Apache Impala  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

S3 genérico

Para obter limitações, consulte Fontes de dados no armazenamento de objetos em Data Virtualization.

 
Google BigQuery

Essa conexão requer consideração especial na Data Virtualization. Consulte Conexão com Google BigQuery em Data Virtualization.

  • Na fonte de dados " Google BigQuery, Data Virtualization não suporta o uso da instrução SELECT para colunas com o tipo de dados " RECORD.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Greenplum  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

MariaDB
  • Os tipos BIT, LONGTEXT e LONGBLOB não são compatíveis com a Data Virtualization.
  • Você deve criar apenas uma conexão com um banco de dados em uma origem de dados MariaDB para evitar linhas duplicadas na página Virtualizar . O MariaDB não suporta o isolamento do banco de dados
  • É necessário ter permissão de administrador para a origem de dados do MariaDB para operações avançadas, como coleta de estatísticas.
  • Para as versões do site MariaDB anteriores à versão 10, não há suporte para a estatística de coleta de catálogo.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Microsoft Azure Data Lake Storage Gen2    
Microsoft Azure SQL Database    
Microsoft SQL Server
  • Quando você usa uma instrução SELECT ou visualiza dados LOB maiores que 64 kB, Data Virtualization de Dados trunca os dados para apenas 64 K bytes.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

MongoDB
  • Os tipos BIT, LONGTEXT e LONGBLOB não são compatíveis com a Data Virtualization.
  • É necessário ter permissão de administrador para a origem de dados do MongoDB para operações avançadas, como coleta de estatísticas.
 
MySQL

(My SQL Community Edition)

(My SQL Enterprise Edition)

  • Você deve criar apenas uma conexão com um banco de dados em uma origem de dados MySQL para evitar linhas duplicadas na página Virtualizar . O MySQL não suporta o isolamento do banco de dados
  • Os tipos de BIT não são compatíveis com a Data Virtualization.
  • A função BIGINT não é compatível com operações de conjunto, como INTERSECT, INTERSECT ALL, EXCEPT, EXCEPT ALL na Data Virtualization.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Oracle
  • Quando você usa uma instrução SELECT ou visualiza dados LOB maiores que 64 kB, Data Virtualization de Dados trunca os dados para apenas 64 K bytes.
  • Os seguintes tipos de dados são convertidos na Data Virtualization:
    • INTERVAL e JSON convertem em VARCHAR.
    • Os tipos de caracteres nacionais convertem em CHAR, VARCHAR ou CLOB.
    • TIMESTAMP e TIMESTAMP WITH LOCAL TIME ZONE convertem em TIMESTAMP.
    • XML converte em CLOB.
    • SMALLINT, INTEGER, BIGINT converter para DECIMAL 4.0, DECIMAL 9.0e DECIMAL 18.0.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

PostgreSQL  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Presto

Se você precisar de conexões duplicadas, a melhor prática é criá-las primeiro no Platform Connections e depois importá-las para o Data Virtualization. Se você seguir esse método, poderá restaurar quaisquer conexões duplicadas que possam ser removidas do Data Virtualization no futuro. As tabelas virtuais antigas que estão vinculadas a essas conexões também são restauradas. No entanto, considere limitar o uso de conexões duplicadas, pois elas exigem mais gerenciamento e podem afetar o desempenho da consulta.

Se você criar uma conexão duplicada diretamente no Data Virtualization cliente Web ou usando a API SETRDBCX , não será possível restaurar a conexão ou as tabelas virtuais vinculadas se elas forem removidas.

Um catálogo padrão é selecionado para você quando cria conexões com Presto. Além disso, é possível acessar objetos virtualizados em um catálogo Presto diferente sem voltar para esse catálogo.

API de REST Essa conexão requer consideração especial em Data Virtualization. Consulte Conexão com a API REST em Data Virtualization.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Salesforce.com  

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

SAP ASE    
SAP OData
Não é possível visualizar ou consultar tabelas não legíveis devido aos motivos a seguir:
  • A origem de dados SAP OData pode ter acesso somente de gravação Nesses casos, mudar as permissões de usuário não evita esse problema.
  • A origem de dados do SAP OData tem acesso de leitura, mas requer filtros Essa limitação significa que não é possível visualizar dados, mas é possível lê-los se você especificar filtros.
 
Snowflake

Essa conexão requer consideração especial na Data Virtualization. Consulte Conectando-se a Snowflake em Data Virtualization.

  • Os tipos de dados ARRAY, GEOGRAPHY e VARIANT são convertidos em VARCHAR.
  • Data Virtualization não é compatível com o ponto de extremidade do Okta URL.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Spark SQL Essa conexão requer consideração especial em Data Virtualization.

Consulte “Conectando-se ao Spark SQL ”.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Teradata

Teradata JDBC Driver Copyright (C) 2024 por. 17.00 Teradata Todos os direitos reservados. IBM fornece o uso incorporado do driver Teradata JDBC sob licença de Teradata exclusivamente para uso como parte da oferta de serviços IBM Watson®.

  • Agora você pode aplicar o agrupamento de consultas para otimizar o processamento ao se conectar a Teradata fontes, anexando pares nome-valor às suas consultas. Consulte a expressão de banda de consulta em Teradata conexão.
  • O tipo de dados XML ' Teradata não é compatível com a Data Virtualization. O tipo de dados XML é convertido em CLOB.
  • Os dados decimais são suportados para 34 dígitos com o DECFLOAT. As colunas de dados que excederem esse limite deverão ser editadas para DOUBLE durante a virtualização.
  • Os seguintes tipos de dados são convertidos na Data Virtualization:
    • Consultas que incluem uma operação de comparação de sequência, como um predicado GROUP BY ou WHERE contra dados CHAR ou VARCHAR para manipular distinção entre maiúsculas e minúsculas.
    • VARBYTE é convertido em VARCHAR por dados de bits.
    • BYTE é convertido em BINARY.
    • BYTEINT é convertido em SMALLINT.
    • TIME ZONE BEARING é convertido em TIME e TIMESTAMP.
    • PERIOD, DISTINCT, DATASET e ARRAY são convertidos em BLOB.
    • NUMBER é convertido em DOUBLE.
    • YEAR, YEAR TO MONTH, DAY, DAY TO MINUTE, HOUR TO MINUTE, MONTH, HOUR e MINUTE são convertidos em INTEGER.
    • DAY TO SECOND, HOUR TO SECOND, MINUTE TO SECOND, SECOND são convertidos em DECIMAL.
  • Quando você usa uma instrução SELECT ou visualiza dados LOB maiores que 64 kB, Data Virtualization de Dados trunca os dados para apenas 64 K bytes.

Esta conexão é otimizada para tirar proveito dos recursos de consulta nesta fonte de dados.

Fontes de dados em armazenamento de objetos na Data Virtualization

Você pode usar dados armazenados como arquivos nas fontes de dados IBM Cloud Object Storage, Amazon S3, Ceph ou MinIO para criar tabelas virtuais. Para acessar dados colocados no armazenamento de objeto de nuvem, deve-se criar uma conexão com a origem de dados na qual os arquivos estão localizados.

É possível segmentar ou combinar dados de um ou mais arquivos para criar uma tabela virtual. O acesso a arquivos no armazenamento de objetos Data Virtualization é baseado em Db2 Big SQL recursos que utilizam o suporte a tabelas externas do Datalake. Para obter mais informações, consulte a instrução CREATE DATALAKE TABLE.

Terminologia

Os depósitos e partições desempenham funções importantes na organização dos dados. Os componentes a seguir são elementos-chave do armazenamento de objeto.
  • Um depósito é uma abstração lógica usada para fornecer um contêiner para dados. Não há conceito de pasta no Object Storage; somente depósitos e chaves. Buckets podem ser criados apenas na interface da origem de dados de armazenamento de objeto Eles não podem ser criados na Data Virtualization. Os nomes dos buckets devem ser exclusivos e obedecer às regras do provedor de armazenamento de objetos. Essas regras geralmente incluem restringir o nome a 3 a 63 caracteres com letras minúsculas, números e traços. Os depósitos devem receber nomes que comecem e terminem com uma letra minúscula ou com um número. Quando Data Virtualization de dados acessa dados no armazenamento de objetos, o nome do bucket deve ser exclusivo em todas as conexões de armazenamento de objetos.
  • Um caminho de arquivo é o caminho completo para o arquivo em que você deseja armazenar dados. A implementação do sistema de arquivos S3 permite que arquivos de comprimento zero sejam tratados como diretórios e que nomes de arquivo que contêm uma barra (/) sejam tratados como diretórios aninhados. O caminho de arquivo inclui o nome do depósito, um caminho de arquivo opcional e um nome de arquivo. No Object Storage, o caminho de arquivo é usado quando uma tabela é criada. Todos os arquivos em um mesmo caminho contribuem para os dados da tabela. É possível incluir mais dados incluindo outro arquivo no caminho de arquivo.
  • Uma partição são dados agrupados por um atributo comum no esquema. O particionamento divide os dados em vários caminhos de arquivo, que são tratados como diretórios Data Virtualization pode descobrir e usar partições para reduzir a quantidade de dados que as consultas devem processar, o que pode melhorar o desempenho das consultas que usam predicados nas colunas de particionamento.

Melhores práticas

Formatos de arquivos
Data Virtualization suporta os formatos de arquivo PARQUET (ou PARQUETFILE), ORC (linhas e colunas otimizadas), CSV (valores separados por vírgula), TSV (valores separados por tabulação) e JSON. Nenhum outro formato de arquivo é suportado.
Observação : Data Virtualization virtualize os arquivos de dados com base em sua estrutura de pastas ou hierarquia. Você deve garantir que todos os seus arquivos de dados dentro da pasta ou hierarquia sejam do mesmo tipo de dados e sigam o mesmo formato.
  • Para PARQUET (ou PARQUETFILE), extensões de arquivo não são necessárias. Os metadados são extraídos do arquivo de dados.
  • Para ORC, extensões de arquivo não são necessárias. Os metadados são extraídos do arquivo de dados.
  • Para arquivos do tipo ` CSV ` e `TSV`:
    • A extensão do arquivo .csv ou .tsv apropriada é necessária, conforme a seguir:
      • CSV : A .csv extensão do arquivo é obrigatória e o conteúdo do arquivo deve seguir as especificações para valores separados por vírgulas.
      • TSV: A extensão do arquivo .tsv é necessária e o conteúdo do arquivo deve seguir as especificações para valores separados por guias.
    • É possível usar um parâmetro opcional para especificar um caractere delimitador de cadeia de caracteres (quoteChar) que envolve os valores dos campos em arquivos do tipo ` CSV ` e `TSV`.
      • O desempenho de consulta dos dados poderá ser impactada negativamente se quoteChar for especificado
      • O valor padrão é sem delimitador (não especificado).
      • O valor para quoteChar deve ser um caractere único que não pode ser um espaço (em branco), barra invertida, tabulação, vírgula ou caractere de nova linha (\n).
      • Se o valor de sequência contiver o delimitador de sequência (quoteChar), a barra invertida (\) poderá ser usada para escapar o delimitador de sequência.
  • Para arquivos JSON, a extensão de arquivo .json é necessária. Os arquivos JSON devem ser codificados para que cada linha seja um objeto JSON válido. As linhas devem ser separadas por um caractere de nova linha (\n). O formato de texto JSON Lines, também chamado de JSON delimitado por nova linha, é o único formato JSON suportado. Esse formato armazena dados estruturados que podem ser processados um registro de cada vez.
Observação: Todos os outros formatos de arquivo retornam um erro. Para obter mais informações, consulte a mensagem de erro exibida ao tentar usar um formato de arquivo não compatível em Cloud Object Storage.
Organizando dados
  • Evite usar caracteres alfanuméricos em nomes de colunas, pois isso pode interferir na compatibilidade do Hive . Qualquer caractere que não seja alfanumérico ou o caractere de sublinhado é codificado como _xNNNN, em que _xNNNN é o valor hexadecimal do caractere. Se desejar visualizar corretamente os nomes de coluna, ative a opção allownonalphanumeric concluindo estas etapas:
    1. Acesse o pod principal na instância de Data Virtualizationc-db2u-dv-db2u-0).
    2. Execute o comando a seguir para editar a configuração para incluir a opção allownonalphanumeric :
      db2uctl adm bigsql config --key bigsql.catalog.identifier.mappingrules --value allownonalphanumeric,allowleadingdigits,allowreservedwords
    3. Execute o comando a seguir para reiniciar Big SQL:
      su - db2inst1 
      bigsql stop ; 
      bigsql start 
      
  • Se seus dados de armazenamento de objeto forem acessados por meio de uma tabela virtualizada, os arquivos que você deseja virtualizar deverão estar em um único caminho de arquivo e em um único depósito e o depósito deverá incluir pelo menos um arquivo que você incluir no carrinho de compras. Todos os arquivos neste caminho de arquivo fazem parte de uma tabela virtualizada. Quando mais dados são incluídos na tabela (novos arquivos são criados no caminho de arquivo), os dados ficam visíveis ao acessar a tabela virtualizada. Todos os arquivos do caminho de arquivo devem utilizar o mesmo formato de arquivo para que sejam virtualizados como uma tabela.
  • Para virtualizar os arquivos em vários caminhos de arquivo como uma tabela, é possível virtualizar o depósito que contém todos os arquivos. Por exemplo, se você tiver caminhos de arquivo A/B/C/T1a, A/B/C/T1b, A/B/D/T1c e A/B/D/T1d, será possível virtualizar o caminho de arquivo A/B/. Todos os arquivos desse caminho e caminhos aninhados serão parte do objeto acessível.
  • Não crie dois objetos (tabelas, esquemas ou colunas) com o mesmo nome, mesmo se você usar identificadores delimitados e letras maiúsculas e minúsculas. Por exemplo, não é possível ter uma tabela t1 e outra tabela denominada T1. Esses nomes são considerados nomes duplicados no Object Storage (Hive). Para obter mais informações, consulte Identificadores.
  • Db2 suporta um intervalo mais amplo de identificadores delimitados válidos do que Hive suporta. Alguns nomes de identificadores que são especificados quando você cria tabelas virtualizadas no armazenamento de objeto podem ser ajustados antes que possam ser aceitos no catálogo do Hive . O mapeamento é feito automaticamente. Para obter mais informações, consulte Identificadores.
  • Quando novos dados forem incluídos no caminho de arquivo para uma tabela virtualizada, considere executar o seguinte comando para assegurar que o cache de metadados seja atualizado para ver os novos dados.
    CALL SYSHADOOP.HCAT_CACHE_SYNC(<schema>, <object>)

    Para obter mais informações, consulte o procedimento armazenado HCAT_CACHE_SYNC.

  • Quando novas partições forem incluídas no caminho de arquivo para a tabela virtualizada, clique em Atualizar partições no menu overflow na página Dados virtualizados para identificar novas partições

    Também é possível executar o comando a seguir na interface SQL para identificar as novas partições incluídas.

    MSCK REPAIR TABLE <table-name> 

    Para obter mais informações, consulte MSCK REPAIR TABLE.

Otimizando o desempenho de consulta
  • Use um formato de arquivo compacto como ORC ou Parquet para minimizar o tráfego de rede, o que melhora o desempenho da consulta.
  • Não utilize o tipo de dados STRING ou TEXT Utilize o tipo de dados VARCHAR(n), com n configurado para um valor que seja apropriado para os dados da coluna. Use o comando a seguir para alterar a tabela para definir um comprimento apropriado para a coluna:
     ALTER TABLE <schema>.<table> ALTER COLUMN <col> SET DATA TYPE VARCHAR(<size>)
  • Particionar seus dados usando o particionamento de estilo Hive . Os dados particionados são agrupados por um atributo comum. Data Virtualization pode usar partições para reduzir a quantidade de dados que as consultas devem processar. A consulta do conjunto de dados inteiro pode não ser possível ou até mesmo necessária. É possível usar predicados em suas consultas que incluem colunas de particionamento para melhorar o desempenho.

    Por exemplo, uma tabela school_records particionada em uma coluna de ano segrega valores por ano em caminhos de arquivo separados. Uma condição WHERE como YEAR=1993, YEAR IN (1996,1995)ou YEAR BETWEEN 1992 AND 1996 varre apenas os dados no caminho de arquivo apropriado para resolver a consulta.

    Exemplo de partições no armazenamento de objeto de nuvem
  • Defina os tipos de colunas particionadas com precisão Por padrão, as colunas de caracteres particionados são assumidas como tipo STRING, o que não é recomendado. Redefina as colunas particionadas para um tipo de dado apropriado
  • Coletar estatísticas sobre os dados que estão sendo consultados. Data Virtualization usa o ANALYZE comando para coletar estatísticas sobre tabelas virtualizadas no armazenamento de objetos. É possível coletar estatísticas no Web client ou usando SQL.. Para obter mais informações, consulte a seção “Coleta de estatísticas” em Data Virtualization.

Limitações

  • O site Data Virtualization suporta apenas a codificação de caracteres UTF-8 para arquivos de texto nos formatos CSV, TSV ou JSON. Os formatos binários do Cloud Object Storage, como ORC ou PARQUET, não são afetados, pois codificam os tipos de caracteres de forma transparente.
  • Data Virtualization não é compatível com o tipo de dados TIME em uma tabela virtualizada sobre o armazenamento de objetos.
  • A visualização de ativos no armazenamento de objeto de nuvem mostra apenas as primeiras 200 colunas da tabela
  • Antes de remover uma conexão com o Cloud Object Storage, deve-se remover todas as tabelas virtualizadas na conexão de armazenamento de objeto Se uma conexão é removida e você tentar remover uma tabela nessa conexão, você vê um erro. Aparece uma mensagem de erro de credenciais ao remover uma tabela virtualizada no armazenamento de objetos.
  • Se o depósito não for especificado nas propriedades da conexão, a conexão será global Nesse caso, inclua o nome do depósito no caminho do arquivo É possível especificar até uma conexão global em uma instância de Data Virtualization.

Veja também Restrições às tabelas de consulta materializadas e Restrições e limitações nas tabelas do Datalake.