Caso de uso da integração dos

Para lidar com o influxo de volumes e fontes de dados díspares, as empresas precisam construir automação e inteligência em seus processos de integração de dados. O Cloud Pak for Data as a Service fornece a plataforma e as ferramentas para orquestrar dados de forma dinâmica e inteligente em uma paisagem distribuída para criar uma rede de alto desempenho de informações instantaneamente disponíveis para consumidores de dados.

Assista a este vídeo para ver o caso de uso de malha de dados para implementação de uma solução de integração de dados em Cloud Pak for Data.

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.

Desafios

À medida que seus tipos de dados e volumes crescem, as empresas enfrentam os seguintes desafios de integração de dados:

Alimentando dados de toda a empresa
Os processos precisam ser capazes de alimentar dados de qualquer aplicativo ou sistema, independentemente de os dados residirem no local, na nuvem ou em um ambiente híbrido.
Integrando dados de várias origens
Os engenheiros de dados devem ser capazes de combinar dados de várias fontes de dados em um único conjunto de dados como um arquivo ou uma tabela virtual
Disponibilizando os dados para usuários
Os engenheiros de dados precisam poder publicar cada conjunto de dados integrado em um único catálogo e todos os usuários que precisam consumir os dados precisam ter acesso de autoatendimento a ele.

Você pode resolver esses desafios e integrar seus dados usando o Cloud Pak for Data as a Service.

Exemplo: desafios do Banco de Ouro

Siga a história do Golden Bank como a equipe de engenharia de dados implementa a integração de Dados. Golden Bank tem uma grande quantidade de dados de clientes e hipotecas que são armazenados em três fontes de dados externas. Os credores usam essas informações para ajudá-los a decidir se eles devem aprovar ou negar os aplicativos de hipoteca. O banco quer integrar os dados das diferentes fontes, e depois entregar que transformaram dados em um único arquivo de saída que pode ser compartilhado.

Processo

Para implementar uma solução de integração de Dados para sua empresa, sua organização pode acompanhar este processo:

  1. Integrar os dados
  2. Compartilhar os dados
  3. Automatizar o ciclo de vida de dados

Os serviços DataStage, Data Virtualization, Data Replication e IBM watsonx.data intelligence em Cloud Pak for Data as a Service fornecem todas as ferramentas e processos de que sua organização precisa para implementar uma solução de integração de dados.

Imagem mostrando o fluxo do caso de uso da integração de dados

1. Integre os dados

Com uma arquitetura de malha de dados que usa o Cloud Pak for Data as a Service, os engenheiros de dados podem otimizar a integração de dados usando cargas de trabalho e políticas de dados para acessar e trabalhar de forma eficiente com dados e combinar dados virtualizados de diferentes fontes, tipos e nuvens como se os dados fosse de uma única fonte de dados. Nessa etapa do processo, os dados brutos são extraídos, ingeridos, virtualizados e transformados em dados consumíveis, de alta qualidade, prontos para serem explorados e, em seguida, orquestrados em seu ciclo de vida de IA.

O que você pode usar O que é possível fazer Melhor usar quando
Data Virtualization Consulte muitas origens de dados como se fosse somente uma. Os engenheiros de dados podem criar tabelas de dados virtuais que podem combinar, unir ou filtrar dados de várias fontes de dados relacionais.

Os engenheiros de dados podem então disponibilizar os dados combinados resultantes como ativos de dados em catálogos. Por exemplo, você pode usar os dados combinados para alimentar painéis, notebooks e fluxos para que os dados possam ser explorados.
Você precisa combinar dados de várias fontes para gerar visualizações.

Você precisa disponibilizar dados combinados como ativos de dados em um catálogo.
DataStage Os engenheiros de dados podem projetar e executar pipelines de dados ETL complexos que movimentam e transformam dados. Você precisa projetar e executar fluxos de dados complexos. Os fluxos devem manipular grandes volumes de dados e conectar-se a uma ampla gama de fontes de dados, integrar e transformar dados, e entregá-los ao seu sistema de destino em lote ou tempo real.
Data Refinery Acesse e refine dados de diversas conexões de origem de dados.

Materialize os conjuntos de dados resultantes como snapshots no tempo que possam combinar, unir, filtrar ou mascarar dados para torná-lo utilizável para cientistas de dados analisar e explorar.

Faça os conjuntos de dados resultantes disponíveis em catálogos.
Você precisa visualizar os dados quando quiser moldar ou limpá-lo.

Quer simplificar o processo de preparação de grandes quantidades de dados brutos para análise.
Data Replication Distribua uma carga de trabalho de integração de dados em diversos sites.

Fornecer a disponibilidade contínua de dados.
Seus dados são distribuídos em diversos sites.

Você precisa de seus dados para estar continuamente disponível.

Exemplo: integração de dados do Banco de Ouro

Os analistas de risco no Golden Bank calculam a taxa de juros diária que eles recomendam oferecer aos mutuários para cada faixa de pontuação de crédito. Os engenheiros de dados usam o DataStage para agregar dados de requisição de hipoteca anônima com as informações pessoalmente identificáveis dos solicitantes de hipoteca O DataStage integra essas informações, incluindo informações de pontuação de crédito para cada candidato, a dívida total do candidato e uma tabela de consulta de taxa de juros. Os engenheiros de dados, então, carregam os dados em um arquivo .csv de saída de destino que pode ser publicado em um catálogo e compartilhado para uso por credores e analistas.


2. Compartiam os dados

O catálogo ajuda suas equipes a entender seus dados do cliente e disponibiliza os dados certos para o uso certo. Os cientistas de dados e outros tipos de usuários podem ajudar a si mesmos aos dados integrados de que precisam enquanto permanecem em conformidade com as políticas de acesso corporativo e de proteção de dados. Eles podem adicionar ativos de dados de um catálogo em um projeto, onde eles colaboram para preparar, analisar e modelar os dados.

O que você pode usar O que é possível fazer Melhor usar quando
Catálogos Use catálogos em IBM watsonx.data intelligence para organizar seus ativos e compartilhá-los entre os colaboradores de sua organização.

Aproveite a pesquisa semântica e as recomendações baseadas em IA para ajudar os usuários a encontrar o que precisam.
Seus usuários precisam entender facilmente, colaborar, enriquecer e acessar os dados de alta qualidade.

Quer aumentar a visibilidade dos dados e a colaboração entre os usuários do negócio.

É preciso que os usuários visualizem, acessem, manipulem e analisem dados sem entender seu formato físico ou local, e sem ter que se mover ou copiá-lo.

Você quer que os usuários aprimorem os ativos, avaliando e revisando-os.

Exemplo: catálogo do Banco de Ouro

O líder da equipe de governança no Golden Bank cria um catálogo, "Catálogo de Aprovação de Hipotecas" e acrescenta os dados de stewards e cientistas de dados como colaboradores do catálogo. Os stewards de dados publicam os ativos de dados que eles criaram no catálogo. Os cientistas de dados encontram os ativos de dados, curados pelos stewards de dados, no catálogo e copiam esses ativos para um projeto. Em seu projeto, os cientistas de dados podem refinar os dados para prepará-los para treinamento de um modelo.


Automatizar o ciclo de vida dos dados

Sua equipe pode automatizar e simplificar o ciclo de vida dos dados com o Orchestration Pipelines.

O que você pode usar O que é possível fazer Melhor usar quando
Orchestration Pipelines Use dutos para criar fluxos repetidos e programados que automatizam sua ingestão de dados e integração. Você deseja automatizar algumas ou todas as etapas em um fluxo de integração de dados.

Exemplo: ciclo de vida automatizado de dados do Banco de Ouro

Os cientistas de dados do Golden Bank podem usar gasodutos para automatizar seu ciclo de integração de dados para manter a corrente de dados.

Tutoriais para integração de Dados

Tutorial Descrição Conhecimento para tutorial
Integrar dados Extraia, filtre, associe e transforme seus dados. Use a interface de arrastar e soltar do DataStage para transformar dados.
Virtualizar dados externos Virtualize e junte tabelas de dados de fontes externas. Use a interface Data Virtualization para virtualizar dados.
Replicar dados Configurado perto de tempo real e replicação contínua entre bancos de dados de origem e destino. Use a ferramenta Data Replication para replicar dados.
Pipeline Orchestrate e AI com integração de dados Crie um pipeline de ponta a ponta que prepara dados e treina um modelo. Use a interface de arrastar e soltar do Orchestration Pipelines para criar um pipeline.

Saiba Mais