Conectores compatíveis para descoberta, enriquecimento e qualidade dos dados
Você pode se conectar a várias fontes de dados das quais é possível importar metadados de ativos e, em seguida, enriquecer esses ativos de dados e avaliar sua qualidade. Você pode criar visualizações dinâmicas dos dados nessas fontes. Você também pode gravar a saída das análises de qualidade dos dados em fontes de dados compatíveis.
Você pode usar conexões com fontes de dados definidas no nível da plataforma, criando cópias de referência em seu projeto ou definindo conexões no projeto.
Os seguintes tipos de conectores são suportados:
- Conectores de armazenamento de arquivos
- Conectores de transmissão de dados
- Conectores de banco de dados
Um traço (—) em qualquer uma das colunas indica que a fonte de dados não é compatível para este fim.
Por padrão, as regras de qualidade de dados e os fluxos subjacentes do DataStage suportam conexões de plataforma padrão. Nem todos os conectores compatíveis com o DataStage tradicional e potencialmente usados em fluxos personalizados do DataStage são compatíveis com o IBM watsonx.data intelligence.
Requisitos e restrições
Compreenda os requisitos e restrições para conexões a serem utilizadas na curadoria de dados e avaliação da qualidade dos dados.
Permissões necessárias
Os usuários devem estar autorizados a acessar as conexões com as fontes de dados. Para importar metadados, o usuário que executa a importação deve ter a permissão SELECT ou uma permissão semelhante nos bancos de dados em questão.
Pré-requisitos gerais
Os ativos de conexão devem existir no projeto para conexões que são usadas nestes casos:
- Para executar o enriquecimento de metadados, incluindo análises avançadas (análise aprofundada da chave primária, análise aprofundada das relações ou criação avançada de perfis de dados) sobre ativos em um enriquecimento de metadados
- Para executar regras de qualidade de dados
- Para criar ativos de dados baseados em consultas ( visualizações dinâmicas )
- Para escrever resultados de verificações de qualidade de dados ou tabelas de distribuição de frequência
Formatos de dados de origem suportados
Em geral, a importação de metadados, o enriquecimento de metadados e as regras de qualidade de dados suportam os seguintes formatos de dados:
Todas: Tabelas de fontes de dados relacionais e não relacionais
Delta Lake e formato de tabela Iceberg para determinados conectores de armazenamento de arquivos. Para que as análises funcionem conforme o esperado, importe arquivos específicos em vez de diretórios de nível superior:
- Para tabelas Delta Lake, importe
_delta_logos arquivos. - Para tabelas Iceberg, importe
metadata/version-hint.textos arquivos.
- Para tabelas Delta Lake, importe
Metadata import : Qualquer formato, desde conexões baseadas em arquivos com as fontes de dados, Avro em conexões de transmissão de eventos e formatos específicos de ferramentas em conexões com ferramentas externas. Para pastas de trabalho do Microsoft Excel, cada planilha é importada como um recurso de dados separado. O nome do recurso de dados é igual ao nome da planilha do Excel.
Enriquecimento de metadados: Tabular: CSV, TSV, Avro, Parquet, Microsoft
ExcelLimitações para arquivos carregados do sistema de arquivos local:- Apenas a primeira folha de uma pasta de trabalho é perfilada.
- Você pode executar análises avançadas apenas em arquivos CSV.
- Para arquivos CSV, execute também a criação de perfis ao executar verificações de qualidade de dados ou atribuição de termos.
Regras de qualidade dos dados: Tabular: Avro, CSV, Parquet, ORC; para ativos de dados carregados a partir do sistema de arquivos local, apenas CSV
Suporte de banco de dados para tabelas de saída de análise
Em geral, tabelas de saída com resultados de análises de qualidade de dados executadas como parte do enriquecimento de metadados, criação de perfis avançados ou execução de regras de qualidade de dados podem ser gravadas nessas bases de dados:
- IBM Db2
- IBM Db2 on Cloud
- Banco de Dados SQL do Microsoft Azure
- Microsoft SQL Server
- Oracle
- PostgreSQL
Se um conector de banco de dados específico também suportar tabelas de saída, a coluna Destino para tabelas de saída exibirá uma marca de seleção.
Conectores de armazenamento de arquivos
| Conector | Metadata import | Enriquecimento de metadados | Regras baseadas em definições |
|---|---|---|---|
| Amazon S3 Delta Lake mesas, mesas Iceberg |
✓ | ✓ | ✓ |
| Apache HDFS | ✓ | ✓ | ✓ |
| Box | ✓ | ✓ 1 | — |
| FTP 2 | ✓ | ✓ | ✓ |
| Tabelas genéricas S3 Delta Lake, tabelas Iceberg |
✓ | ✓ | ✓ |
| Google Cloud Storage Delta Lake mesas, mesas Iceberg |
✓ | ✓ | ✓ |
| IBM Cloud Object Storage Delta Lake mesas, mesas Iceberg |
✓ | ✓ | ✓ |
| IBM Master Data Management | ✓ | ✓ | ✓ |
| IBM Planning Analytics | ✓ | ✓ | ✓ |
| Microsoft Azure Blob Storage | ✓ | ✓ | ✓ |
| Microsoft Azure Data Lake Storage Delta Lake mesas, mesas Iceberg |
✓ | ✓ | ✓ |
Notas:
1 A análise avançada não é suportada para esta fonte de dados.
2 Use o modo de conexão SSH (SFTP) e desmarque a caixa de seleção Usar home como root ao configurar a conexão.
Conectores de transmissão de dados
| Conector | Metadata import | Enriquecimento de metadados | Regras baseadas em definições |
|---|---|---|---|
| Apache Kafka 1 | ✓ | ✓ | ✓ |
Notas:
1 A conexão deve ser configurada para utilizar um registro de esquemas do tipo Confluent para determinar o formato da mensagem (formato Avro). Assim, as mensagens dos tópicos podem ser lidas como dados tabulares, de modo que possam ser processadas pelas ferramentas de curadoria de dados estruturados.
Processamento de dados em fluxo contínuo
Os dados de fluxo são processados da seguinte forma:
Metadata import o: Todo o tópico “ Kafka ” é lido e um ativo em formato tabular é criado no projeto ou no catálogo. Na repetição, o tópico inteiro é lido novamente.
Enriquecimento de metadados: Na execução inicial do enriquecimento, a criação de perfis, a geração de verificações de qualidade dos dados e a análise da qualidade dos dados são realizadas em todos os registros do tópico. Por padrão, apenas os registros recém-adicionados são analisados nas execuções subsequentes. Para garantir que todo o tópico seja sempre analisado, você pode desativar a análise incremental nas configurações do projeto para o enriquecimento de metadados. Consulte as configurações padrão para o enriquecimento de metadados.
Análises avançadas, como a criação de perfis avançados ou a análise aprofundada de palavras-chave, são sempre realizadas em todo o tópico.
Resultados da análise incremental:
A página Perfil exibe os resultados relativos ao número de registros da janela atual.
A página “Qualidade dos dados” sempre exibe a contagem agregada de registros, juntamente com os problemas consolidados e a pontuação correspondente a essa contagem. Essa contagem de registros e essas informações sobre problemas não são alteradas quando os registros são excluídos do tópico “ Kafka ”, o que resulta em uma discrepância entre a contagem de registros na página “Qualidade dos dados” e a contagem real de registros no tópico.
Além disso, se forem adicionadas verificações de qualidade dos dados, a contagem de registros começa a partir da janela em que essas verificações são aplicadas pela primeira vez.
Importante:Tenha em mente as seguintes informações sobre novas execuções de enriquecimento:
Se você alterar a configuração do projeto entre execuções de análise — seja para desativar ou ativar a análise incremental —, as contagens de registros de um ativo analisado anteriormente ficarão fora de sincronia. O histórico de processamento ou os pontos de verificação não são rastreados. Portanto, não é possível determinar quantos registros já foram processados com o tipo de análise utilizado em execuções anteriores.
Se você executar novamente o enriquecimento de metadados com a criação de perfis e verificações de qualidade de dados ativadas e o número de registros da janela de análise atual for 0, as verificações poderão ser removidas e as informações na página “Qualidade dos Dados” sobre as verificações aplicadas anteriormente poderão ser apagadas.
Como prática recomendada, atualize o enriquecimento de metadados para que seja executado sem a geração de verificações de qualidade de dados depois de analisar as verificações detectadas e constatar que elas atendem aos seus requisitos de qualidade de dados. As etapas subsequentes de enriquecimento utilizam, então, as verificações existentes para a análise da qualidade dos dados.
Regras de qualidade de dados: Após a execução inicial, as novas execuções de uma verificação de qualidade de dados avaliam apenas os registros que foram adicionados ao ativo após a última execução.
Quando uma regra é criada para um ativo de dados em fluxo, a
consumer_group_namepropriedade da conexão é automaticamente definida comoDataQualityRule_<RuleId>. Esse grupo fixo de consumidores resulta em um processamento incremental dos registros. É possível alterar o comportamento de quaisquer regras que utilizem a mesma conexão Kafka em um projeto específico para que sempre analisem todos os registros no tópico Kafka. Use a API a seguir:PATCH /data_quality/v3/projects/{project_id}/settingsO corpo da solicitação deve ter a seguinte aparência:
[ { "op": "replace", "path": "connection_configurations", "value": [ { "connection": { "id": "<connection_id>" }, "source": { "properties": { "consumer_group_name": "DataQualityRule_#DSJobRunId#" } } } ] } ]A
#DSJobRunId#parte do nome do grupo de consumidores garante que um novo grupo de consumidores seja gerado a cada execução da regra, de modo que todos os registros sejam lidos novamente a cada execução. Para voltar ao comportamento de análise incremental, atualize as configurações do projeto novamente removendo aconsumer_group_namepropriedade, o que fará com que a configuração padrão do grupo de consumidores seja utilizada.Resultados da análise incremental:
- O histórico de cada execução mostra a contagem de registros da janela correspondente como o número de registros testados e os números correspondentes de registros que atenderam ou não aos critérios da regra.
- A página “Qualidade dos dados” sempre exibe a contagem agregada de registros, juntamente com os problemas consolidados e a pontuação correspondente a essa contagem. Essa contagem de registros e essas informações sobre problemas não são alteradas quando os registros são excluídos do tópico “ Kafka ”, o que resulta em uma discrepância entre a contagem de registros na página “Qualidade dos dados” e a contagem real de registros no tópico.
Se você configurar uma tabela de saída para regras de qualidade de dados, certifique-se de usar o método de atualização adequado para seus objetivos. Para obter mais informações, consulte “Configurando as opções de saída para regras de qualidade de dados ”.
Análise de perfil na guia “Perfil” de um ativo: a análise de perfil é sempre executada em todos os registros. Não é realizada nenhuma análise de perfil incremental.
Conectores de banco de dados
| Conector | Metadata import | Enriquecimento de metadados | Regras baseadas em definições | Regras baseadas em SQL | Ativos de dados baseados em SQL | Destino das tabelas de saída |
|---|---|---|---|---|---|---|
| Amazon Aurora for MySQL | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Amazon Aurora for PostgreSQL | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Amazon DynamoDB | ✓ | ✓ | ✓ | — | — | — |
| Amazon RDS for MySQL | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Amazon RDS for Oracle | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Amazon RDS for PostgreSQL | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Amazon Redshift | ✓ | ✓ 1 | ✓ | ✓ | ✓ | — |
| Apache Cassandra | ✓ | ✓ | ✓ | ✓ | ✓ | — |
| Apache Hive | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ 5 |
| Apache Impala com Apache Kudu | ✓ | ✓ | ✓ | ✓ | ✓ | — |
| AWS Databricks | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ 10 |
| DataStax Enterprise | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ 9 |
| Denodo | ✓ | ✓ | ✓ | ✓ | ✓ | — |
| Dremio | ✓ | ✓ | ✓ | ✓ | ✓ | — |
| Google BigQuery | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ 6 |
| Greenplum | ✓ | ✓ | ✓ | ✓ | ✓ | — |
| IBM Cloud Databases for MongoDB | ✓ | ✓ | — | — | — | — |
| IBM Cloud Databases for MySQL | ✓ | ✓ | — | — | — | — |
| IBM Cloud Databases for PostgreSQL | ✓ | ✓ | — | — | — | — |
| IBM Cloudant | ✓ | ✓ 1 | — | — | — | — |
| IBM Data Virtualization | ✓ | ✓ | ✓ | ✓ | ✓ | — |
| IBM Data Virtualization Manager for z/OS 2 | ✓ | ✓ | — | — | — | — |
| IBM Db2 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| IBM Db2 Big SQL | ✓ | ✓ | — | — | — | — |
| IBM Db2 for i | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| IBM Db2 for z/OS | ✓ | ✓ | — | — | — | — |
| IBM Db2 on Cloud | ✓ | ✓ | ✓ | ✓ | — | ✓ |
| IBM Db2 Warehouse | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| IBM Informix | ✓ | ✓ | — | — | — | — |
| IBM Netezza Performance Server | ✓ | ✓ | ✓ | ✓ | — | — |
| Connector | Metadata import | Enriquecimento de metadados | Regras baseadas em definições | Regras baseadas em SQL | Ativos de dados baseados em SQL | Destino das tabelas de saída |
| MariaDB | ✓ | ✓ | — | — | — | — |
| Microsoft Azure Databricks 7 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Microsoft Azure Fabric Warehouse | ✓ | ✓ | ✓ | ✓ | ✓ | — |
| Banco de Dados SQL do Microsoft Azure | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Microsoft SQL Server | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| MongoDB | ✓ | ✓ | ✓ | ✓ | — | — |
| MySQL | ✓ | ✓ | ✓ | ✓ | ✓ | — |
| Oracle 3 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| PostgreSQL | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Salesforce.com | ✓ | ✓ 4 | ✓ | ✓ | ✓ | — |
| SAP ASE | ✓ | ✓ 1 | ✓ | ✓ | ✓ | — |
| SAP OData Método de autenticação: nome de usuário e senha |
✓ | ✓ 8 | ✓ | — | — | — |
| SingleStoreDB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Snowflake | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Teradata | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
Notas:
1 A análise avançada não é suportada para esta fonte de dados.
2 Com o Data Virtualization Manager for z/OS, você adiciona dados e COBOL copybooks ativos de sistemas mainframe para catálogos em IBM Cloud Pak for Data. Os copybooks são arquivos que descrevem a estrutura de dados de um programa COBOL. O Data Virtualization Manager for z/OS ajuda a criar tabelas virtuais e visualizações nos mapas do copybook COBOL. Em seguida, é possível usar essas tabelas virtuais e visualizações para importar e catalogar dados de mainframes para o IBM Cloud Pak for Data na forma de ativos de dados e ativos do copybook COBOL.
Os seguintes tipos de mapas de cadernos de exercícios COBOL não são importados: ACI, Catálogo, Natural
Quando a importação for concluída, será possível acessar o catálogo para revisar os ativos importados, incluindo os mapas do copybook COBOL, tabelas virtuais e visualizações. É possível usar esses ativos das mesmas maneiras que outros ativos no Cloud Pak for Data.
Para obter informações adicionais, consulte Incluindo ativos de copybook COBOL.
3 As descrições das tabelas e colunas são importadas apenas se a conexão estiver configurada com uma das seguintes opções de descoberta de metadados :
- Nenhum sinônimo
- Comentários e sinônimos
4 Alguns objetos no esquema SFORCE não são suportados. Veja Salesforce.com.
5 Para criar tabelas de saída de enriquecimento de metadados em Apache Hive em uma versão anterior a 3.0.0, defina os seguintes parâmetros de configuração no seu servidor Apache Hive :
set hive.support.concurrency=true;
set hive.exec.dynamic.partition.mode=nonstrict;
set hive.txn.manager=org.apache.hadoop.hive.ql.lockmgr.DbTxnManager;
set hive.enforce.bucketing=true; # (not required for version 2)
set hive.compactor.initiator.on=true;
set hive.compactor.cleaner.on=true; # might not be available depending on the version
set hive.compactor.worker.threads=1;
Para obter mais informações, consulte Transações do Hive.
6 Tabelas de saída para criação de perfis avançados: se você executar novamente a criação de perfis avançados em intervalos muito curtos, os resultados podem se acumular, pois os dados podem não ser atualizados com rapidez suficiente no Google BigQuery. Aguarde pelo menos 90 minutos antes de executar novamente a análise avançada com o mesmo destino de saída. Para obter mais informações, consulte Disponibilidade de dados de fluxo. Como alternativa, você pode definir uma tabela de saída diferente.
7 Metastore do Hive e catálogo Unity
8 A informação sobre se o ativo de dados é uma tabela ou uma visualização não pode ser recuperada e, portanto, não é mostrada nos resultados do enriquecimento.
9 Apenas resultados relativos à qualidade dos dados.
10 Tabelas de saída para análise avançada de desempenho: evite nomes de catálogos e esquemas com hífens, pois sabe-se que a taxa de saída é extremamente lenta.