Uso da aprendizagem incremental para treinar com um grande conjunto de dados
Use algoritmos de aprendizagem incremental para treinar um experimento AutoAI com lotes de dados.
Se você estiver treinando usando uma fonte de dados grande, os dados serão subamostrados, de modo que o treinamento inicial ocorrerá com uma parte dos dados. O limite de dados de treinamento depende do tamanho do ambiente selecionado para o experimento.
Os algoritmos de aprendizagem incremental podem ser usados para continuar o treinamento usando os dados restantes em uma fonte de subamostragem, dividindo os dados restantes em lotes, se necessário. Cada lote de dados de treinamento é pontuado independentemente, usando a métrica otimizada, para que você possa analisar o desempenho de cada lote ao explorar os resultados.
Como funciona a aprendizagem incremental
A configuração do experimento para dar suporte à aprendizagem incremental adiciona duas fases ao processo de treinamento. O primeiro aplica um algoritmo de conjunto de árvores em lote para preparar os pipelines. O estágio final treina os pipelines com os lotes de dados. Os pipelines são pontuados e classificados com base no desempenho dos dados de holdout para o experimento, de acordo com a métrica otimizada.
Você pode continuar o treinamento incremental de um pipeline em um notebook gerado automaticamente se quiser fornecer mais dados para o experimento.
Ativação de configurações para aprendizagem incremental
Para especificar configurações para treinamento com um grande conjunto de dados:
- Abra as configurações do experimento para seu experimento.
- Na página Predictions (Previsões ), revise a seleção Algorithms to include (Algoritmos para incluir ).
- Alterne as opções para Suporta aprendizagem incremental para algoritmos selecionados que suportam aprendizagem incremental. Você pode usar os algoritmos para treinar pipelines de forma incremental posteriormente em um notebook gerado automaticamente.
Observações:- Ative a aprendizagem incremental para algoritmos específicos se você planeja treinar com alguns dados na interface do usuário, mas continue treinando em lotes depois de salvar o pipeline do candidato a modelo como um notebook gerado automaticamente.
- Para realizar a aprendizagem incremental, um algoritmo selecionado que ofereça suporte à aprendizagem incremental pode exigir um algoritmo complementar (conjunto de árvores em lote) para treinar automaticamente os pipelines.
- A aprendizagem incremental não está disponível com a configuração pequena (2 vCPUs e 8 GB de RAM).
- Ative o suporte para aprendizado incremental para incluir algoritmos que suportam treinamento de um pipeline com lotes de dados de um grande conjunto de dados.
- Ative a opção "Train incrementally by using remaining data" para treinar automaticamente com todos os dados quando você executar o experimento
- Para conservar os recursos computacionais, você pode escolher a opção Stop pipeline training when quality is stable para interromper o treinamento quando um limite de estabilidade for atingido. O valor padrão é interromper o treinamento quando 5 lotes não mostrarem nenhuma melhoria na pontuação da métrica otimizada. Você pode ajustar o valor para cima ou para baixo.

Treine seu experimento. A visualização mostra as etapas de preparação para a aprendizagem incremental e, em seguida, o treinamento dos pipelines com os lotes de dados.

Quando o treinamento estiver concluído, revise os pipelines. Os pipelines criados com suporte para aprendizagem incremental exibem uma tag de especialização incr. Clique em qualquer pipeline para visualizar os detalhes do pipeline medido em relação à métrica otimizada.
Salvar um pipeline como um notebook com aprendizado incremental ativado
Salve um pipeline como um notebook para que você possa revisar o código que criou o notebook para obter total transparência. Se o pipeline usar um algoritmo de conjunto em lote habilitado para aprendizagem incremental, você poderá continuar a treinar o experimento no notebook com mais lotes de dados.
- Clique em Salvar como notebook para um pipeline de aprendizagem incremental para continuar o treinamento.
- Escolha um ambiente de tempo de execução para o notebook.
Notas:
- O notebook de aprendizado incremental requer mais recursos do que um pipeline AutoAI padrão ou um notebook de experimentos, portanto, os ambientes de tempo de execução desse notebook são maiores do que os de um notebook padrão.
- O notebook gerado usa um DataLoader compatível com o torch chamado
ExperimentIterableDataset. Esse carregador de dados pode trabalhar com várias fontes de dados, incluindo Db2, PostgreSQL, Amazon S3, e Snowflake. Você pode personalizar o notebook para usar um carregador de dados diferente, desde que ele retorne lotes de dados como o Pandas DataFrames.
Revisão dos resultados do experimento
Depois que seu experimento concluir o treinamento, você poderá analisar os pipelines na tabela de classificação. Os pipelines são classificados de acordo com o desempenho em relação à métrica otimizada. Clique em um nome de pipeline para explorar detalhes sobre como o pipeline foi gerado.
Compreensão dos resultados e comparações do pipeline
Observe esses detalhes sobre como os pipelines são pontuados e classificados:
- Para pipelines treinados em lotes, as pontuações são calculadas para cada lote de dados de modo que seja possível revisar o desempenho por lote. No entanto, as pontuações finais dos pipelines são calculadas usando os dados de treinamento e de retenção que são usados para treinar pipelines padrão (sem aprendizado incremental). Esse processo garante que os pipelines finais sejam pontuados e classificados usando os mesmos dados para uma comparação justa.
- Ao revisar as pontuações do pipeline na tabela de classificação, você pode descobrir que os pipelines com mais transformações aplicadas não têm pontuações melhores do que um pipeline sem as transformações. Esse resultado pode ocorrer porque a fase de engenharia de recursos para treinar o experimento encontra a melhor transformação em uma amostra dos dados de treinamento, por motivos de desempenho. Por isso, pode acontecer que um recurso recém-gerado não melhore significativamente a pontuação de um pipeline treinado no conjunto completo de dados.
Próximas etapas
AutoAI detalhes da implementação da aprendizagem incremental
- Para saber mais sobre o treinamento de experimentos AutoAI com dados grandes, leia o artigo do blog Large tabular data & AutoAI.