Tutorial de integração de dados: Orquestrar um pipeline de IA com integração de dados

Pegue este tutorial para criar um pipeline de ponta a ponta para entregar dados concisos, pré-processados e atualizados armazenados em uma fonte de dados externa com o trial de malha de dados. Seu objetivo é usar o Orchestration Pipelines para orquestrar esse fluxo de trabalho de ponta a ponta, a fim de gerar resultados automatizados, consistentes e repetíveis. O pipeline utiliza DataStage e AutoAI,, que automatizam vários aspectos do processo de construção de modelos, tais como a engenharia de características e a otimização de hiperparâmetros. AutoAI classifica os algoritmos candidatos e, em seguida, seleciona o melhor modelo.

Iniciação rápida: se você ainda não tiver criado o projeto de amostra para este tutorial, acesse Orquestrar um projeto de amostra de pipeline de IA no hub de Recurso.

A história para o tutorial é que o GoldenBank quer expandir seus negócios, oferecendo renovações especiais de baixa taxa para aplicações online. Os aplicativos on-line expandem o alcance do cliente do banco e reduzem os custos de processamento de aplicativos do banco. A equipe utilizará o Orchestration Pipelines para criar um fluxo de dados que forneça informações atualizadas sobre todos os requerentes de empréstimos hipotecários, que as instituições financeiras poderão usar na tomada de decisões. Os dados são armazenados em Db2 Warehouse. Você precisa preparar os dados porque ele é potencialmente incompleto, desatualizado e pode ser ofuscado ou inteiramente inacessível devido a políticas de privacidade e soberania de dados. Em seguida, a equipe precisa construir um modelo de aprovação de hipoteca a partir de dados confiáveis e, em seguida, implantar e testar o modelo em um ambiente de pré-produção.

A imagem animada a seguir fornece uma prévia rápida do que você vai realizar até o final deste tutorial. Você irá editar e executar um pipeline para construir e implantar um modelo de aprendizado de máquina. Clique na imagem para visualizar uma imagem maior.

Imagem animada

Visualizando o tutorial

Neste tutorial, você concluirá estas tarefas:

Assistir vídeo Assista a este vídeo para visualizar as etapas deste tutorial. Pode haver ligeiras diferenças na interface do usuário que é mostrada no vídeo. O vídeo tem como objetivo ser um acompanhante para o tutorial escrito.

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.





Dicas para concluir este tutorial
Aqui estão algumas dicas para concluir com sucesso este tutorial.

Use a imagem em vídeo

Dica: Inicie o vídeo, em seguida, à medida que você rola através do tutorial, o vídeo se move para o modo picture-in-picture. Feche a tabela de vídeos do conteúdo para a melhor experiência com foto-em-foto. Você pode usar o modo picture-in-picture para que você possa acompanhar o vídeo conforme concluir as tarefas neste tutorial. Clique nos timestamps para cada tarefa seguir junto.

A imagem animada a seguir mostra como usar os recursos de imagem em vídeo e de índice:

Como usar picture-in-picture e capítulos

Configure as janelas do navegador

Para uma experiência ideal ao concluir este tutorial, abra sua conta em uma janela do navegador e mantenha esta página do tutorial aberta em outra janela do navegador para alternar facilmente entre as duas janelas. Considere organizar as duas janelas do navegador lado a lado para facilitar o acompanhamento.

Tutorial lado-a-lado e UI

Dica: se você encontrar um tour guiado ao concluir este tutorial na interface com o usuário, clique em Talvez posterior.



Configure os pré-requisitos

Inscreva-se para o Cloud Pak for Data as a Service

Deve-se se inscrever para o Cloud Pak for Data as a Service e provisionar os serviços necessários para o caso de uso de integração de Dados

  • Se você tiver uma conta existente do Cloud Pak for Data as a Service , será possível iniciar este tutorial. Se você tiver uma conta do plano Lite, apenas um usuário por conta poderá executar este tutorial
  • Se você ainda não tem uma conta, inscreva-se para o teste.

Ícone de Vídeo Assista ao vídeo a seguir para saber mais sobre a malha de dados no Cloud Pak for Data.

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.

Verifique os serviços fornecidos necessários

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 00:37.

Siga estas etapas para verificar ou fornecer os serviços necessários:

  1. No Menu de Menu de NavegaçãoNavegação, selecione Serviços > Instâncias de serviço.

  2. Use a lista suspensa Produto para determinar se existe uma instância do serviço watsonx.ai Studio.

  3. Se você precisar criar uma instância de serviço do watsonx.ai Studio, clique em Adicionar serviço.

    1. Selecione watsonx.ai Studio.

    2. Selecione o plano Lite ..

    3. Clique em Criar.

  4. Aguarde enquanto o serviço watsonx.ai Studio é provisionado, o que pode levar alguns minutos para ser concluído.

  5. Repita essas etapas para verificar ou provisionar os serviços adicionais a seguir:

    • watsonx.ai Runtime
    • DataStage
    • Cloud Object Storage

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra as instâncias de serviço fornecidas:

Serviços provisionados

Abra o projeto de amostra

vídeo do tutorial de visualização Para visualizar essa tarefa, assista ao vídeo começando em 01:14.

Se você já tem o projeto de amostra para este tutorial, então pule esta tarefa. Caso contrário, siga estas etapas:

  1. Acesse o projeto de amostra Orchestrate an AI pipeline no hub de recursos.

  2. Clique em Criar projeto.

  3. Se solicitado a associar o projeto a uma instância Cloud Object Storage, selecione uma instância Cloud Object Storage a partir da lista.

  4. Clique em Criar.

  5. Aguarde a importação do projeto ser concluída e, em seguida, clique em Visualizar novo projeto para verificar se o projeto e os ativos foram criados com êxito.

  6. Clique na guia Ativos para ver a conexão, fluxos e definição de dados do DataStage e o pipeline.

Nota: você pode ver um tour guiado mostrando os tutoriais que estão incluídos com esse caso de uso. Os links no tour guiado abrirão estas instruções do tutorial..
Dica: se você não vir nenhum fluxo do DataStage , então volte para visualizar suas instâncias de serviço para verificar sua instância do DataStage provisionada com sucesso. Consulte Provisionar os serviços necessários.

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra a guia Ativos no projeto de amostra. Agora você está pronto para iniciar o tutorial.

A imagem a seguir mostra a guia Ativos no projeto de amostra.

Associe o serviço de tempo de execução watsonx.ai ao projeto de amostra

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 02:04.

Você usará watsonx.ai Runtime para criar e implantar o modelo, portanto, siga estas etapas para associar a instância do serviço watsonx.ai Runtime ao projeto de amostra.

  1. No projeto Orquestrar um pipeline de IA , clique na guia Gerenciar

  2. Clique na página Serviços e Integrações ..

  3. Clique em Associar serviço.

  4. Marque a caixa ao lado de sua instância do serviço watsonx.ai Runtime.

  5. Clique em Associar..

  6. Clique em Cancelar para retornar à página Serviços e Integrações ..

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra a página Serviços e integrações com o serviço watsonx.ai Runtime listado. Agora você está pronto para criar o projeto de amostra..

Serviço associado com projeto




Tarefa 1: Visualizar os ativos no projeto de amostra

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 02:26.

O projeto de amostra inclui vários ativos, incluindo uma conexão, uma definição de dados, dois fluxos do DataStage e um pipeline Siga estas etapas para visualizar esses ativos:.

  1. Clique na guia Ativos no projeto Orchestrate an AI pipeline e, em seguida, visualize Todos os ativos.

  2. Todos os ativos de dados usados nos fluxos do DataStage e no pipeline são armazenados em uma conexão do Data Fabric Trial- Db2 Warehouse no esquema AI_MORTGAGE . A imagem a seguir mostra os ativos dessa conexão:

    Db2 Warehouse tabelas

  3. O fluxo Integrar Dados de Hipoteca DataStage integra dados sobre cada requerente de hipoteca, incluindo informações pessoalmente identificáveis, com seus detalhes do aplicativo, escores de crédito, status como um comprador comercial e, finalmente, os preços da casa escolhida de cada requerente e, em seguida, cria um arquivo sequencial com o nome Mortgage_Data.csv no projeto que contém os dados unidos.. A imagem a seguir mostra o fluxo Integrar dados de hipoteca DataStage .

    Dica: se você não vir nenhum fluxo do DataStage , então volte para visualizar suas instâncias de serviço para verificar sua instância do DataStage provisionada com sucesso. Consulte Provisionar os serviços necessários.

    Integrar Fluxo de Dados de hipoteca

  4. O fluxo Integrar aprovações de hipoteca DataStage usa a saída do primeiro fluxo do DataStage (Mortgage_Data.csv) e enriquece ainda mais os dados integrando informações sobre cada aprovação do aplicativo de hipoteca. O conjunto de dados resultante é salvo no projeto com o nome Mortgage_Data_with_Approvals.csv.. A imagem a seguir mostra o fluxo Integrar aprovações de hipoteca DataStage :

    Integrar Fluxo de Aprovações de hipoteca

  5. A definição de dados Definition_Mortgage_Data para o ativo de dados Mortgage_Data_with_Approvals.csv é criada pelo fluxo Integrar aprovações de hipotecas DataStage . A imagem a seguir mostra a definição de dados:

    Definição Data de hipoteca

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra todos os ativos no projeto de amostra. Agora você está pronto para explorar o pipeline no projeto de amostra.

A imagem a seguir mostra todos os ativos no projeto de amostra.




Tarefa 2: Explore um pipeline existente

vídeo do tutorial de visualização Para visualizar essa tarefa, assista ao vídeo começando em 04:00.

O projeto de exemplo inclui um ` Orchestration Pipelines `, que automatiza as seguintes tarefas:

  • Execute duas tarefas existentes do DataStage

  • Crie um experimento do AutoAI

  • Execute o experimento AutoAI e salve o modelo de melhor desempenho que usa o arquivo de saída resultante da tarefa DataStage como dados de treinamento.

  • Crie um espaço de implementação.

  • Promova o modelo salvo para o espaço de implementação

Siga estas etapas para explorar o pipeline:

  1. Na guia Ativos no projeto Orchestrate an AI pipeline, visualize Todos os ativos.

  2. Clique em Pipeline de aprovação de hipoteca para abrir o pipeline.

  3. Na seção inicial do pipeline, duas tarefas do DataStage (Integrar dados de hipoteca e Integrar aprovações de hipoteca) são executadas em sequência para combinar várias tabelas da conexão do Db2 Warehouse on Cloud em um conjunto de dados rotulado coeso que é usado como os dados de treinamento para o experimento AutoAI .

  4. Clique duas vezes no nó Check Status para ver a condição. Essa condição é um ponto de decisão no pipeline para confirmar a conclusão da primeira tarefa do DataStage com um valor de Concluído ou Concluído com avisos. Clique em Cancelar para retornar para o pipeline

  5. Clique duas vezes no nó Criar AutoAI experimento para ver as configurações. Esse nó cria um experimento do AutoAI com as configurações

    1. Revise os valores para as seguintes configurações:

      • Nome do experimento de AutoAI

      • Escopo

      • Tipo de predição

      • Coluna da predição

      • Classe positiva

      • Razão de divisão de dados de treinamento

      • Algoritmos a serem incluídos

      • Algoritmos para usar

      • Otimizar a métrica

    2. Clique em Cancelar para fechar as configurações..

  6. Clique duas vezes no nó Executar AutoAI experimento para ver as configurações. Esse nó executa o experimento AutoAI que é criado a partir do nó Criar AutoAI experimento que usa a saída da tarefa Integrar Aprovação Hipotecária DataStage como os dados de treinamento.

    1. Revise os valores para as seguintes configurações:

      • Experimento do AutoAI

      • Ativos de dados de treinamento

      • Prefixo de nome do modelo

    2. Clique em Cancelar para fechar as configurações..

  7. Entre os nós Executar o experimento AutoAI e Criar Espaço de Implementação , clique duas vezes no Deseja implementar o modelo? nó para ver a condição. O valor de True para essa condição é um ponto de decisão no pipeline para continuar criando o espaço de implementação. Clique em Cancelar para retornar para o pipeline

  8. Dê um clique duplo no nó Criar Espaço de Implementação para ver as configurações Esse nó cria um novo espaço de implantação com o nome especificado e requer entrada para os serviços Cloud Object Storage e watsonx.ai Runtime.

    1. Revise o valor para a configuração Novo nome do espaço .

    2. Para o campo CRN da nova instância do COS de espaço , selecione a sua instância do Cloud Object Storage na lista

    3. No campo New space WML Instance CRN, selecione sua instância de tempo de execução watsonx.ai na lista.

    4. Clique em Salvar.

  9. Clique duas vezes no nó Promover Modelo para Espaço de Implementação para ver as configurações. Este nó promove o melhor modelo do nó Executar AutoAI experimento para o espaço de implementação criado a partir do nó Criar Espaço de Implementação .

    1. Revise os valores para as seguintes configurações:

      • Ativos de origem

      • Destino

    2. Clique em Cancelar para fechar as configurações..

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra o pipeline inicial Agora você está pronto para editar o pipeline para incluir um nó.

Pipeline inicial




Tarefa 3: Adicionar um nó ao pipeline

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 06:23.

O pipeline cria o modelo, cria um espaço de implementação e, em seguida, promove-o para um espaço de implementação. Você precisa adicionar um nó para criar uma implementação online. Siga estas etapas para editar o pipeline para automatizar a criação de uma implementação online:

  1. Inclua o nó Criar Implementação Online na tela:

    1. Expanda a seção Criar na paleta do nó

    2. Arraste o nó Criar implementação on-line para a tela e solte o nó após o nó Promover Modelo para Espaço de Implementação .

  2. Passe o mouse sobre o nó Promover Modelo para Espaço de Implementação para ver a seta. Conecte a seta ao nó Criar implementação online .

    Nota: os nomes do nó em seu pipeline podem ser diferentes da imagem animada a seguir:

    Nós de conexão de pipeline

  3. Conecte o comentário Criar implementação on-line para o modelo promovido ao nó Criar implementação on-line conectando o círculo na caixa de comentário para o nó

    Nota: os nomes do nó em seu pipeline podem ser diferentes da imagem animada a seguir:

    Comentário de pipeline

  4. Clique duas vezes no nó Criar implementação on-line para ver as configurações..

  5. Altere o nome do nó para Create Online Deployment

  6. Próximo a Ativo ML, clique em Selecionar de outro nó no menu.

    Selecione a partir de outro ativo do nó ML

  7. Selecione o nó Promover Modelo para o Espaço de Implementação na lista O ID do nó winning_model está selecionado.

  8. Para Novo nome de implementação, digite mortgage approval model deployment.

  9. Para o Modo de Criação, selecione Sobrescrever

  10. Clique em Salvar para salvar as configurações do nó Criar Implementação On-line

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra o pipeline concluído.. Agora você está pronto para executar o pipeline.

Pipeline concluído




Tarefa 4: Executar o pipeline

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir dos 07:38.

Agora que o pipeline está concluído. siga estas etapas para executar o pipeline:

  1. Na barra de ferramentas, clique em Executar pipeline> Executar avaliação.

  2. Na página Definir parâmetros de pipeline , selecione True para a implementação..

    • Se configurado como True, o pipeline verifica o modelo implementado e pontua o modelo.

    • Se configurado como False, o pipeline verifica se o modelo foi criado no projeto pelo experimento AutoAI e revisa as informações do modelo e as métricas de treinamento.

  3. Se esta ocasião é o seu primeiro tempo executando um pipeline, você é solicitado a fornecer uma chave API. Os ativos de pipeline usam sua chave de API pessoal do IBM Cloud para executar operações com segurança sem interrupção.

    • Se você tiver uma chave de API existente, clique em Usar chave de API existente, cole a chave de API e clique em Salvar.

    • Se você não tiver uma chave de API existente, clique em Gerar nova chave de API, forneça um nome e clique em Salvar.. Copie a chave API e, em seguida, salve a chave API para uso futuro. Quando terminar, clique em Fechar.

  4. Clique em Executar para iniciar a execução do pipeline

  5. Role através de logs consolidados enquanto o pipeline está em execução. A execução do julgamento pode levar até 10 minutes minutos para ser concluída.

  6. À medida que cada operação for concluída, selecione o nó para aquela operação na tela.

  7. Na guia Inspetor do Nó , visualize os detalhes da operação

  8. Clique na guia Saída do nó para ver um resumo da saída para cada operação do nó

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra o pipeline após ele ter concluído a execução de avaliação. Agora você está pronto para revisar os ativos que o pipeline criou.

Execução concluída de pipeline




Tarefa 5: Visualizar os ativos, modelo implementado e implementação online

vídeo do tutorial de visualização Para visualizar esta tarefa, assista ao vídeo a partir do minuto 09:48.

O gasoduto criou vários ativos. Siga estas etapas para visualizar os ativos:

  1. Clique no nome do projeto Orquestrate an AI pipeline na trilha de navegação para retornar ao projeto.

    Trilha de navegação

  2. Na guia Ativo , visualize Todos os ativos..

  3. Visualizar os ativos de dados.

    1. Clique no ativo de dados Mortgage_Data.csv .. A tarefa do DataStage criou esse ativo

    2. Clique no nome do projeto na trilha de navegação para retornar à guia Ativos .

    3. Clique no ativo de dados do Mortgage_Data_with_Approvals.csv A tarefa do DataStage criou esse ativo

    4. Clique no nome do projeto na trilha de navegação para retornar à guia Ativos .

  4. Visualizar o modelo.

    1. Clique no ativo do modelo de aprendizado de máquina que começa com mortgage_approval_best_model O experimento do AutoAI gerou vários candidatos de modelo e escolheu esse como o melhor modelo.

    2. Scroll através das informações do modelo.

    3. Clique no nome do projeto na trilha de navegação para retornar à guia Ativos .

  5. Clique na guia Tarefas no projeto para ver informações sobre as duas tarefas do DataStage e uma tarefa de Pipeline em execução

  6. No Menu de Menu de NavegaçãoNavegação, selecione Implantações.

  7. Clique na guia Espaços ..

  8. Clique no espaço de implementação Aprovação de Hipoteca

  9. Clique na guia Ativos e veja o modelo implementado que começa com mortgage_approval_best_model

  10. Clique na guia Implementações.

  11. Clique em Implementação do modelo de aprovação de hipoteca para visualizar a implementação..

    1. Visualize as informações na guia Referência da API ..

    2. Clique na guia Testar.

    3. Clique na guia Entrada JSON e substitua o texto de amostra pelo texto JSON a seguir.

      {
         "input_data": [
             {
                     "fields": [
                             "ID",
                             "NAME",
                             "STREET_ADDRESS",
                             "CITY",
                             "STATE",
                             "STATE_CODE",
                             "ZIP_CODE",
                             "EMAIL_ADDRESS",
                             "PHONE_NUMBER",
                             "GENDER",
                             "SOCIAL_SECURITY_NUMBER",
                             "EDUCATION",
                             "EMPLOYMENT_STATUS",
                             "MARITAL_STATUS",
                             "INCOME",
                             "APPLIEDONLINE",
                             "RESIDENCE",
                             "YRS_AT_CURRENT_ADDRESS",
                             "YRS_WITH_CURRENT_EMPLOYER",
                             "NUMBER_OF_CARDS",
                             "CREDITCARD_DEBT",
                             "LOANS",
                             "LOAN_AMOUNT",
                             "CREDIT_SCORE",
                             "CRM_ID",
                             "COMMERCIAL_CLIENT",
                             "COMM_FRAUD_INV",
                             "FORM_ID",
                             "PROPERTY_CITY",
                             "PROPERTY_STATE",
                             "PROPERTY_VALUE",
                             "AVG_PRICE"
                     ],
                     "values": [
                             [
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     "Bachelor",
                                     "Employed",
                                     null,
                                     144306,
                                     null,
                                     "Owner Occupier",
                                     15,
                                     19,
                                     2,
                                     7995,
                                     1,
                                     1483220,
                                     437,
                                     null,
                                     false,
                                     false,
                                     null,
                                     null,
                                     null,
                                     111563
                             ],
                             [
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     null,
                                     "High School",
                                     "Employed",
                                     null,
                                     45283,
                                     null,
                                     "Private Renting",
                                     11,
                                     13,
                                     1,
                                     1232,
                                     1,
                                     7638,
                                     706,
                                     null,
                                     false,
                                     false,
                                     null,
                                     null,
                                     null,
                                     547262
                             ]
                     ]
             }
         ]
      }
      
    4. Clique em Prever. Os resultados mostram que o primeiro requerente não será aprovado e o segundo requerente será aprovado.

ícone de ponto de verificação Verifique seu progresso

A imagem a seguir mostra os resultados do teste.

Previsões de resultados do teste



A equipe do Golden Bank utilizou o Orchestration Pipelines para criar um fluxo de dados que fornece informações atualizadas sobre todos os candidatos a empréstimos hipotecários, bem como um modelo de aprendizado de máquina que as instituições financeiras podem utilizar na tomada de decisões.


Limpeza (Opcional)

Se você gostaria de reaproveitar este tutorial, exclua os seguintes artefatos.

Artefato Como excluir
Implantação do Modelo de Aprovação de hipoteca no espaço de implantação de aprovação de hipoteca Excluir uma implementação
Espaço de implantação de aprovação de Excluir um espaço de implementação
Orquestrar um projeto de amostra de pipeline de IA Excluir um Projeto

Próximas etapas

Saiba Mais