Caso de uso da integração dos
Para lidar com o influxo de volumes e fontes de dados díspares, as empresas precisam construir automação e inteligência em seus processos de integração de dados. O Cloud Pak for Data as a Service fornece a plataforma e as ferramentas para orquestrar dados de forma dinâmica e inteligente em uma paisagem distribuída para criar uma rede de alto desempenho de informações instantaneamente disponíveis para consumidores de dados.
Assista a este vídeo para ver o caso de uso de malha de dados para implementação de uma solução de integração de dados em Cloud Pak for Data.
Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.
Desafios
À medida que seus tipos de dados e volumes crescem, as empresas enfrentam os seguintes desafios de integração de dados:
- Alimentando dados de toda a empresa
- Os processos precisam ser capazes de alimentar dados de qualquer aplicativo ou sistema, independentemente de os dados residirem no local, na nuvem ou em um ambiente híbrido.
- Integrando dados de várias origens
- Os engenheiros de dados devem ser capazes de combinar dados de várias fontes de dados em um único conjunto de dados como um arquivo ou uma tabela virtual
- Disponibilizando os dados para usuários
- Os engenheiros de dados precisam poder publicar cada conjunto de dados integrado em um único catálogo e todos os usuários que precisam consumir os dados precisam ter acesso de autoatendimento a ele.
Você pode resolver esses desafios e integrar seus dados usando o Cloud Pak for Data as a Service.
Exemplo: desafios do Banco de Ouro
Siga a história do Golden Bank como a equipe de engenharia de dados implementa a integração de Dados. Golden Bank tem uma grande quantidade de dados de clientes e hipotecas que são armazenados em três fontes de dados externas. Os credores usam essas informações para ajudá-los a decidir se eles devem aprovar ou negar os aplicativos de hipoteca. O banco quer integrar os dados das diferentes fontes, e depois entregar que transformaram dados em um único arquivo de saída que pode ser compartilhado.
Processo
Para implementar uma solução de integração de Dados para sua empresa, sua organização pode acompanhar este processo:
Os serviços DataStage, Data Virtualization, Data Replication e IBM watsonx.data intelligence em Cloud Pak for Data as a Service fornecem todas as ferramentas e processos de que sua organização precisa para implementar uma solução de integração de dados.
1. Integre os dados
Com uma arquitetura de malha de dados que usa o Cloud Pak for Data as a Service, os engenheiros de dados podem otimizar a integração de dados usando cargas de trabalho e políticas de dados para acessar e trabalhar de forma eficiente com dados e combinar dados virtualizados de diferentes fontes, tipos e nuvens como se os dados fosse de uma única fonte de dados. Nessa etapa do processo, os dados brutos são extraídos, ingeridos, virtualizados e transformados em dados consumíveis, de alta qualidade, prontos para serem explorados e, em seguida, orquestrados em seu ciclo de vida de IA.
| O que você pode usar | O que é possível fazer | Melhor usar quando |
|---|---|---|
| Data Virtualization | Consulte muitas origens de dados como se fosse somente uma. Os engenheiros de dados podem criar tabelas de dados virtuais que podem combinar, unir ou filtrar dados de várias fontes de dados relacionais. Os engenheiros de dados podem então disponibilizar os dados combinados resultantes como ativos de dados em catálogos. Por exemplo, você pode usar os dados combinados para alimentar painéis, notebooks e fluxos para que os dados possam ser explorados. |
Você precisa combinar dados de várias fontes para gerar visualizações. Você precisa disponibilizar dados combinados como ativos de dados em um catálogo. |
| DataStage | Os engenheiros de dados podem projetar e executar pipelines de dados ETL complexos que movimentam e transformam dados. | Você precisa projetar e executar fluxos de dados complexos. Os fluxos devem manipular grandes volumes de dados e conectar-se a uma ampla gama de fontes de dados, integrar e transformar dados, e entregá-los ao seu sistema de destino em lote ou tempo real. |
| Data Refinery | Acesse e refine dados de diversas conexões de origem de dados. Materialize os conjuntos de dados resultantes como snapshots no tempo que possam combinar, unir, filtrar ou mascarar dados para torná-lo utilizável para cientistas de dados analisar e explorar. Faça os conjuntos de dados resultantes disponíveis em catálogos. |
Você precisa visualizar os dados quando quiser moldar ou limpá-lo. Quer simplificar o processo de preparação de grandes quantidades de dados brutos para análise. |
| Data Replication | Distribua uma carga de trabalho de integração de dados em diversos sites. Fornecer a disponibilidade contínua de dados. |
Seus dados são distribuídos em diversos sites. Você precisa de seus dados para estar continuamente disponível. |
Exemplo: integração de dados do Banco de Ouro
Os analistas de risco no Golden Bank calculam a taxa de juros diária que eles recomendam oferecer aos mutuários para cada faixa de pontuação de crédito. Os engenheiros de dados usam o DataStage para agregar dados de requisição de hipoteca anônima com as informações pessoalmente identificáveis dos solicitantes de hipoteca O DataStage integra essas informações, incluindo informações de pontuação de crédito para cada candidato, a dívida total do candidato e uma tabela de consulta de taxa de juros. Os engenheiros de dados, então, carregam os dados em um arquivo .csv de saída de destino que pode ser publicado em um catálogo e compartilhado para uso por credores e analistas.
Automatizar o ciclo de vida dos dados
Sua equipe pode automatizar e simplificar o ciclo de vida dos dados com o Orchestration Pipelines.
| O que você pode usar | O que é possível fazer | Melhor usar quando |
|---|---|---|
| Orchestration Pipelines | Use dutos para criar fluxos repetidos e programados que automatizam sua ingestão de dados e integração. | Você deseja automatizar algumas ou todas as etapas em um fluxo de integração de dados. |
Exemplo: ciclo de vida automatizado de dados do Banco de Ouro
Os cientistas de dados do Golden Bank podem usar gasodutos para automatizar seu ciclo de integração de dados para manter a corrente de dados.
Tutoriais para integração de Dados
| Tutorial | Descrição | Conhecimento para tutorial |
|---|---|---|
| Integrar dados | Extraia, filtre, associe e transforme seus dados. | Use a interface de arrastar e soltar do DataStage para transformar dados. |
| Virtualizar dados externos | Virtualize e junte tabelas de dados de fontes externas. | Use a interface Data Virtualization para virtualizar dados. |
| Replicar dados | Configurado perto de tempo real e replicação contínua entre bancos de dados de origem e destino. | Use a ferramenta Data Replication para replicar dados. |
| Pipeline Orchestrate e AI com integração de dados | Crie um pipeline de ponta a ponta que prepara dados e treina um modelo. | Use a interface de arrastar e soltar do Orchestration Pipelines para criar um pipeline. |