Tutorial de integração de dados: Virtualize dados externos

Pegue este tutorial para virtualizar dados armazenados em três fontes de dados externas com o caso de uso de integração de dados do julgamento de malha de dados. Seu objetivo é usar Data Virtualization para criar tabelas virtuais e unir as tabelas virtuais a partir dos dados existentes que se encontram em três fontes de dados: um Db2 Warehouse, um banco de dados PostgreSQL e um banco de dados MongoDB. Se você concluiu o tutorial Integrar dados, realizou muitas das mesmas tarefas usando o DataStage que este tutorial realiza usando a Data Virtualization.

Iniciação rápida: se você ainda não criou o projeto de amostra para este tutorial, acesse o Projeto de Amostra de Integração de Dados no hub de Recurso.

A história para o tutorial é que o Golden Bank precisa aderir a um novo regulamento em que não pode emprestar a candidatos a empréstimos sub-qualificados. Você usará Data Virtualization para combinar dados de diferentes fontes de dados sem movimentação de dados e disponibilizar os dados virtuais para outros cientistas de dados e engenheiros de dados em um projeto.

A imagem animada a seguir fornece uma prévia rápida do que você vai realizar até o final deste tutorial. Você se conectará a fontes de dados externas, criará tabelas virtuais e visualizações e as adicionará a um projeto. Clique na imagem para visualizar uma imagem maior.

Imagem animada

Visualizando o tutorial

Neste tutorial, você concluirá estas tarefas:

Assistir vídeo Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver ligeiras diferenças na interface do usuário mostrada no vídeo. O vídeo tem como objetivo ser um acompanhante para o tutorial escrito.

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.





Dicas para concluir este tutorial
Aqui estão algumas dicas para concluir com sucesso este tutorial.

Use a imagem em vídeo

Dica: Inicie o vídeo, em seguida, à medida que você rola através do tutorial, o vídeo se move para o modo picture-in-picture. Feche a tabela de vídeos do conteúdo para a melhor experiência com foto-em-foto. Você pode usar o modo picture-in-picture para que você possa acompanhar o vídeo conforme concluir as tarefas neste tutorial. Clique nos timestamps para cada tarefa seguir junto.

A imagem animada a seguir mostra como usar os recursos de imagem em vídeo e de índice:

Como usar picture-in-picture e capítulos

Configure as janelas do navegador

Para uma experiência ideal ao concluir este tutorial, abra sua conta em uma janela do navegador e mantenha esta página do tutorial aberta em outra janela do navegador para alternar facilmente entre as duas janelas. Considere organizar as duas janelas do navegador lado a lado para facilitar o acompanhamento.

Tutorial lado-a-lado e UI

Dica: se você encontrar um tour guiado ao concluir este tutorial na interface com o usuário, clique em Talvez posterior.



Configure os pré-requisitos

Inscreva-se para o Cloud Pak for Data as a Service

Deve-se se inscrever para o Cloud Pak for Data as a Service e provisionar os serviços necessários para o caso de uso de integração de Dados

  • Se você tiver uma conta existente do Cloud Pak for Data as a Service , será possível iniciar este tutorial. Se você tiver uma conta do plano Lite, apenas um usuário por conta poderá executar este tutorial
  • Se você ainda não tiver uma conta, inscreva-se para uma avaliação de tecido de dados.

Ícone de Vídeo Assista ao vídeo a seguir para saber mais sobre a malha de dados no Cloud Pak for Data.

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.

Verifique os serviços fornecidos necessários

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 01:06.

Siga estas etapas para verificar ou fornecer os serviços necessários:

  1. No menu Navegação Menu de Navegação, selecione Serviços > Instâncias de serviço.

  2. Use a lista suspensa Product (Produto ) para determinar se existe uma instância de serviço do Data Virtualization.

  3. Se você precisar criar uma instância de serviço de Data Virtualization, clique em Adicionar serviço.

    1. Selecione Data Virtualization.

    2. Selecione o plano Lite ..

    3. Clique em Criar.

  4. Aguarde enquanto o serviço Data Virtualization é provisionado, o que pode levar alguns minutos para ser concluído.

  5. Repita essas etapas para verificar ou provisionar os serviços adicionais a seguir:

    • IBM watsonx.data intelligence
    • Cloud Object Storage

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra as instâncias de serviço fornecidas:

Serviços provisionados

Criar o projeto de amostra

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir de 01:46.

Se você já tiver o projeto de amostra para este tutorial, vá para Tarefa 1. Caso contrário, siga estas etapas:

  1. Acesse o projeto de amostra de integração de dados no hub de recursos.

  2. Clique em Criar projeto.

  3. Se solicitado a associar o projeto a uma instância Cloud Object Storage, selecione uma instância Cloud Object Storage a partir da lista.

  4. Clique em Criar.

  5. Aguarde a importação do projeto ser concluída e, em seguida, clique em Visualizar novo projeto para verificar se o projeto e os ativos foram criados com êxito.

  6. Clique na guia Ativos para ver as conexões e o fluxo do DataStage

Nota: Você pode ver uma visita guiada mostrando os tutoriais que estão incluídos com este caso de uso. Os links na visita guiada abrirá estas instruções de tutorial.

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra a guia Ativos no projeto de amostra Agora você está pronto para iniciar o tutorial.

Projeto de amostra




Tarefa 1: Verifique o catálogo de ativos da Platform assets catalog

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 02:42.

Você pode adicionar conexões em fontes de dados externas no nível da plataforma ou no nível de serviço. Quando você adiciona as conexões no nível da plataforma usando o Platform assets catalog, pode incluir facilmente essas conexões em projetos, catálogos e fontes de dados Data Virtualization. Siga estas etapas para verificar o Platform assets catalog

  1. No menu Navegação Menu de Navegação, selecione Dados > Conexões da plataforma.

  2. Se você vir conexões existentes, já terá um Platform assets cataloge poderá ir para Tarefa 2. Se você não vir nenhuma conexão, mas vir uma opção para criar uma nova conexão, pule para a Tarefa 2.
    Novo botão de conexão

  3. Se você não tiver um Platform assets catalog, clique em Criar catálogo. Criar catálogo de ativos da plataforma

  4. Selecione um Cloud Object Storage na lista.

  5. Aceite o valor padrão para Manipulação de ativo duplicado.

  6. Clique em Criar. A página Conexões da Plataforma é exibida

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra as conexões da plataforma: A partir daqui, é possível criar conexões Como o projeto de amostra inclui as conexões, é possível incluir as conexões para as origens de dados externas neste catálogo a partir do projeto de amostra.

Platform assets catalog




Tarefa 2: Adiciar conexões de dados com o catálogo de ativos da Platform assets catalog

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 03:22.

O projeto de amostra de integração de dados inclui várias conexões com origens de dados externas Em seguida, você adiciona três conexões ao Platform assets catalog e pode disponibilizar essas conexões na Data Virtualization. Siga estas etapas para publicar as conexões do projeto da amostra no Platform assets catalog.

  1. No menu Navegação Menu de Navegação, selecione Projetos > Exibir todos os projetos.

  2. Clique no projeto Integração de dados .

  3. Clique na guia Ativos.

  4. Em Tipos de ativo, selecione Acesso a dados> Conexões.

  5. Selecione os seguintes ativos de conexão:

    • Data Fabric de avaliação- Db2 Warehouse
    • Data Fabric Avaliação- MongoDB
    • Data Fabric Avaliação- Databases for PostgreSQL
  6. Clique em Publicar no Catálogo

    1. Selecione o Catálogo de ativos de plataforma na lista e clique em Avançar.

    2. Revise os ativos e clique em Publicar.

  7. No menu Navegação Menu de Navegação, selecione Dados > Conexões de plataforma para ver as três conexões publicadas no catálogo.

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra as três conexões da Plataforma. Agora você está pronto para incluir origens de dados.

Três conexões de plataforma




Tarefa 3: Adicionar fontes de dados à Data Virtualization

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 04:05.

Agora você pode adicionar essas fontes de dados externas do Platform assets catalog à Data Virtualization. Siga estas etapas para incluir as origens de dados:.

  1. No menu Navegação Menu de Navegação, selecione Dados > Data virtualization.

    Nota: se você vir uma notificação para Configurar um catálogo primário para aplicar o controle, será possível fechar com segurança essa notificação. A configuração de um catálogo primário é opcional.
  2. Na página Fontes de dados, na exibição Tabela, clique em Adicionar conexão > Conexão de plataforma existente.
    Incluir conexão existente

  3. Selecione Data Fabric Trial- Db2 Warehouse.

  4. Clique em Incluir.

  5. Repita essas etapas para incluir as conexões Data Fabric Trial-Mongo DB e Data Fabric Trial- Databases for PostgreSQL .

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra as origens de dados Agora você está pronto para criar uma tabela virtual a partir de dados armazenados nessas origens de dados externas.

Origens de dados




Tarefa 4: Virtualizar tabelas de dados

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 04:40.

Você deseja virtualizar as tabelas MORTGAGE_APPLICATION, MORTGAGE_RECORRENTEe CREDIT_SCORES Mais tarde, você pode se juntar às duas primeiras tabelas virtuais com a terceira tabela para criar uma nova visão de junção virtual. Siga estas etapas para virtualizar as tabelas de dados:

  1. No menu de serviço, clique em Virtualização > Virtualizar.
    Virtualize no menu de serviços

  2. Se necessário, altere a visualização Tabelas e aguarde enquanto as tabelas são carregadas, o que pode levar até 30 segundos. Pode ser necessário clicar em Atualizar , para ver a lista completa de tabelas Ao ver Tabelas disponíveis, todas as tabelas serão carregadas. O número de mesas pode variar.
    Virtualizar lista de tabelas disponíveis

  3. Na guia Tabelas , filtre as tabelas com base nos seguintes critérios:

    1. Conector: IBM Db2 Warehouse e PostgreSQL

    2. Banco de dados: Data Fabric Avaliação- Db2 Warehouse e Data Fabric Avaliação- Databases for PostgreSQL

    3. Esquema: BANKING

  4. Selecione as tabelas MORTGAGE_APPLICATION, MORTGAGE_RECORRENTEe CREDIT_SCORE para virtualizar.. É possível passar o mouse sobre um nome de tabela para ver o nome completo para verificar se você está selecionando os nomes de tabelas corretos

  5. Clique em Incluir no Carrinho de Compras.

  6. Clique em Visualizar carrinho para visualizar sua seleção. A partir daqui, é possível editar os nomes da tabela e do esquema, ou remover uma seleção do seu carrinho.

  7. Por enquanto, desmarque a caixa de seleção ao lado de Designar ao projeto Esta ação disponibilizará as tabelas virtuais na página Dados virtualizados

  8. Clique em Virtualizar.

  9. Clique em Confirmar para iniciar a virtualização das tabelas

  10. Quando a virtualização estiver concluída, clique em Acessar Dados Virtualizados para ver sua tabela recém-criada

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra a página Dados virtualizados .. Agora você está pronto para criar uma tabela virtual juntando essas tabelas virtuais.

Dados virtualizados




Tarefa 5: Criar visualizações de junção virtual associando tabelas virtuais

Você deseja criar uma visualização de junção virtual juntando as tabelas virtuais MORTGAGE_RECORRENTE e MORTGAGE_APPLICATION Em seguida, você deseja associar o objeto virtual resultante com a tabela virtual CREDIT_SCORE para criar uma segunda visualização de junção virtual

Visualização de junção virtual 1: Junte-se às tabelas virtuais MORTGAGE_RECORRENTE e MORTGAGE_APPLICATION

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 05:59.

Siga estas etapas para criar a primeira visualização de junção virtual::

  1. Na página Dados virtualizados , selecione as tabelas MORTGAGE_APPLICATION e MORTGAGE_RECORRENTE para virtualizar..

  2. Anote o nome do esquema. Você precisará desse nome posteriormente para executar uma consulta SQL.

  3. Clique em Associar

  4. Na lista de colunas da tabela MORTGAGE_APPLICATION, arraste para conectar a coluna ID com a coluna ID na tabela MORTGAGE_APPLICANT.
    Unir objetos virtuais usando ID para chave

  5. Selecione todas as colunas em ambas as tabelas

  6. Clique em Visualizar para ver uma visualização das tabelas unidas

  7. Fechar a janela de pré-visualização.

  8. Clique em Abrir no editor de SQLe, em seguida, clique em Continuar no aviso de que não é possível retornar à tela de junção. O Editor SQL permite que você execute consultas no conjunto de dados. Nesse caso, você deseja visualizar quais registros o conjunto de dados conterá ao filtrar os candidatos da Califórnia.

    Abrir editor de SQL

    1. Copie seu esquema e, em seguida, exclua a consulta existente. Você precisará inserir seu esquema na próxima instrução SQL.

    2. Copie e cole a instrução SELECT a seguir para a nova consulta. Substitua <your schema> pelo nome do esquema que você observou anteriormente.

      SELECT * FROM <your-schema>.MORTGAGE_APPLICANT WHERE STATE_CODE LIKE 'CA'
      

      Sua consulta parece semelhante a SELECT * FROM DV_IBMID_663002GN1Q.MORTGAGE_APPLICANT WHERE STATE_CODE LIKE 'CA'
      Instrução de Seleção

    3. Clique em Executar todos

    4. Depois que a consulta for concluída, selecione a consulta na guia Histórico Na guia Resultados , é possível ver que a tabela é filtrada para apenas os candidatos do estado da Califórnia

    5. Clique em Voltar para fechar o editor de SQL.

  9. Agora que você visualiza o conjunto de dados filtrado em requerentes da Califórnia, você adicionará este critério de filtro à visão de junção virtual. Para a tabela MORTGAGE_RECORRENTE , copie a instrução a seguir para os critérios de filtro. Substitua <your schema> pelo nome do esquema que você observou anteriormente.

    "<your-schema>"."MORTGAGE_APPLICANT"."STATE_CODE"='CA'
    

    Seus critérios de filtro são semelhantes a "DV_IBMID_663002GN1Q". "MORTGAGE_APPLICANT". "STATE_CODE"='CA'

    Critérios de filtro

  10. Clique em Avançar.

  11. Você pode editar os nomes da coluna para diferenciar entre colunas com o mesmo nome em ambas as tabelas. Nesse caso, mantenha os nomes de colunas padrão, e clique em Avançar

  12. Na página Designar e revisar , para Nome da visualização, digite APPLICANTS_APPLICATIONS_JOINED.

  13. Por enquanto, desmarque a opção Designar para o projeto Posteriormente, você cria um objeto virtual e atribui isso ao projeto de integração de dados.

  14. Clique em Criar visualização.

  15. Quando a virtualização for concluída, clique em Acessar dados virtualizados para ver sua visualização de junção recém-criada..

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra a página Dados virtualizados .. Agora você está pronto para criar uma segunda visualização de junção virtual.

Dados virtualizados

Visualização de junção virtual 2: associar as tabelas virtuais APPLICANTS_APPLICATIONS_JOIN e CREDIT_SCORE

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 07:47.

Siga estas etapas para criar a segunda visualização de junção virtual:

  1. Na página Dados virtualizados , selecione as tabelas APPLICANTS_APPLICATIONS_JUNTADAS e CREDIT_SCORE para virtualizar

  2. Clique em Associar

  3. Na lista de colunas para a tabela APPLICANTS_APPLICATIONS_UNIDA , arraste para conectar a coluna EMAIL_ADDRESS com a coluna EMAIL_ADDRESS na tabela CREDIT_SCORE

  4. Clique em Visualizar para ver uma visualização das tabelas unidas

  5. Fechar a janela de pré-visualização.

  6. Clique em Avançar.

  7. Aceite os nomes de colunas padrão, e clique em Avançar

  8. Na página Designar e revisar , para Nome da visualização, digite APPLICANTS_APPLICATIONS_CREDIT_SCORE_JOINED.

  9. Desta vez, mantenha Designar ao projeto selecionado e, em seguida, escolha o projeto de Integração de Dados

  10. Clique em Criar visualização.

  11. Quando a virtualização for concluída, clique em Acessar dados virtualizados para ver sua visualização de junção recém-criada..

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra a página Dados virtualizados .. Agora você está pronto para trabalhar com dados virtuais em seu projeto.

Dados virtualizados




Tarefa 6: Gerar uma chave API

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 08:27.

Você precisa fornecer suas credenciais pessoais na forma de uma chave API para visualizar ativos virtualizados. Se você ainda não tem uma chave de API salva, então siga estas etapas para criar uma chave de API.

  1. Acesse a página de chaves de API no console do IBM Cloud. Faça login se solicitado.

  2. Na página Chaves API , clique em Criar uma chave API do IBM Cloud. Se você tiver alguma chave API existente, o botão poderá ser rotulado Criar.

  3. Digite um nome e uma descrição.

  4. Clique em Criar.

  5. Copiar a chave de API.

  6. Faça o download da chave de API para uso futuro.

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra a página de chaves de API. Agora você está pronto para visualizar a tabela virtual no projeto.

Página de chaves de API




Tarefa 7: Acesse a visão de junção virtual no projeto

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 09:01.

A tabela virtual foi adicionada ao seu projeto junto com uma conexão com a Data Virtualization. Siga estas etapas para abrir o projeto para ver os dados virtuais e as informações de conexão que são necessárias para acessar os dados virtuais.

  1. Volte para o Cloud Pak for Data. No Menu de Menu de NavegaçãoNavegação, selecione Projetos > Exibir todos os projetos.

  2. Abra o projeto de Integração de Dados

  3. Clique na guia Ativos.

  4. Abra qualquer um dos dados virtualizados. Por exemplo, clique no ativo de dados que começa com o nome do esquema seguido por APPLICANTS_APPLICATIONS_CREDIT_SCORE_ATRÁS para visualizá-lo (a)

  5. Forneça suas credenciais para acessar o ativo de dados.

  6. Para o Método de autenticação, selecione Chave API.

  7. Cole sua chave API.
    Colar chave de API

  8. Clique em Conectar.

  9. Percorra o ativo de dados para ver todos os candidatos do estado da Califórnia.

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra os dados virtuais no projeto Agora você está pronto para analisar os dados virtuais.

Visualizar tabela virtual



Como engenheiro de dados do Golden Bank, você usou Data Virtualization para combinar dados de diferentes fontes de dados e com diferentes tipos. Você usou a sintaxe SQL e acessou e combinou dados sem movimento de dados.


Limpeza (Opcional)

Se você gostaria de reaproveitar os tutoriais no caso de uso de integração de dados, exclua os seguintes artefatos.

Artefato Como excluir
Conexões no catálogo de ativos da Platform assets catalog Remover um ativo de um catálogo
Dados virtualizados Navegue até Dados > Data virtualization; Na página Dados virtualizados, acesse o menu Excesso Menu overflow de uma tabela e selecione Remover.
Origens de dados Navegue até Dados > Data virtualization; Na página Fontes de dados, clique no ícone Excluir Excluir para uma conexão.
Projeto amostra de integração de dados Excluir um Projeto

Próximas etapas

Saiba Mais