Selecionando um modelo do AutoAI

O AutoAI prepara dados automaticamente, aplica algoritmos e tenta construir pipelines de modelo mais adequados para seus dados e caso de uso. Saiba como avaliar os pipelines de modelo para que seja possível salvar um como modelo.

Revisando resultados do experimento

Durante o treinamento do AutoAI, seu conjunto de dados é dividido em uma parte de treinamento e uma parte de validação. A parte de treinamento é usada pelos estágios de treinamento do AutoAI para gerar os pipelines do modelo AutoAI e pontuações de validação cruzada que são usados para classificá-los. Após o treinamento do AutoAI , a peça de validação é usada para a avaliação e o cálculo do modelo de pipeline resultante de informações de desempenho, como curvas ROC e matrizes de confusão, que são mostradas na tabela de classificação. A razão de divisão de treinamento/validação é 90/10. 

À medida que o treinamento progride, um infográfico dinâmico e uma classificação geral são apresentados a você. Passe o mouse sobre nós no infográfico para explorar os fatores que os pipelines compartilham e suas propriedades exclusivas. Para um guia para os dados no infográfico, clique na guia Legenda no painel de informações. Ou, para ver uma visão diferente da criação do pipeline, clique na guia de detalhes do Experimento do painel de notificações, em seguida, clique em Alternar visualizações para visualizar o mapa de progresso. Em qualquer visualização, clique em um nó de pipeline para visualizar o pipeline associado na tabela de classificação. O leaderboard contém condutas de modelo que são classificadas por pontuações de validação cruzada.

Visualizar as transformações de pipeline

Passe o mouse sobre um nó no infográfico para visualizar as transformações para um pipeline. A sequência de transformações de dados consiste em um transformador de pré-processamento e em uma sequência de transformadores de dados, se a engenharia de recursos foi realizada para o pipeline. O algoritmo é determinado pelas etapas de seleção e otimização de modelo durante o treinamento do AutoAI.

Transformação de pipeline para modelos AutoAI

Consulte Detalhes da implementação para revisar os detalhes técnicos para a criação de pipelines.

Visualizar a tabela de classificação

Cada pipeline de modelo é pontuado para várias métricas e depois ranqueado. A métrica de classificação padrão para modelos de classificação binária é a área sob a curva ROC. Para modelos de classificação multi-classe a métrica padrão é a precisão. Para modelos de regressão, a métrica padrão é o erro quadrático médio da raiz (RMSE) Os oleodutos de alto-ranqueamento são exibidos em um leaderboard, assim, é possível visualizar mais informações sobre eles. O leaderboard também fornece a opção de salvar os pipelines de modelos selecionados depois de revisá-los.

Modelos AutoAI de tabela de classificação

É possível avaliar os pipelines conforme a seguir:

  • Clique em um pipeline na tabela de classificação para visualizar mais detalhes sobre as métricas e o desempenho.
  • Clique em Comparar para visualizar como os principais pipelines se comparam
  • Classifique a tabela de classificação por uma métrica diferente.

Expandindo um pipeline do AutoAI

A função Log Loss não está disponível para o Classificador de SnapSVM, pois este não fornece estimativas de probabilidade de classe. Nesse caso, o campo “Log Loss” fica em branco na tabela de classificação.

Visualizando a matriz de confusão

Um dos detalhes que é possível visualizar para um pipeline para um experimento de classificação binária é uma Matriz de confusão.

A matriz de confusão é baseada nos dados de holdout, que é a parte do dataset de treinamento que não é usada para treinamento do pipeline de modelo mas apenas usada para medir seu desempenho em dados que não foram vistos durante o treinamento.

Em um problema de classificação binária com uma classe positiva e uma classe negativa, a matriz de confusão resume as previsões positivas e negativas do modelo de pipeline em quatro quadrantes dependendo de sua correção em relação aos rótulos de classe positiva ou negativa do conjunto de dados de holdout.

Por exemplo, o experimento de amostra do Banco busca identificar os clientes que levam promoções que lhes são oferecidas. A matriz de confusão para os principais pipelines é:

Matriz de Confusão


A classe positiva é 'sim' (significando que um usuário assume a promoção). Você pode ver que a mensuração de verdadeiros negativos, ou seja, clientes o modelo previsto corretamente eles recusariam suas promoções, é alta.

Clique nos itens no menu de navegação para visualizar outros detalhes sobre o pipeline selecionado. Por exemplo, Importância do recurso mostra quais recursos de dados contribuem mais para sua saída de predição.

Salvar um pipeline como um modelo

Quando estiver satisfeito com um pipeline, salve-o usando um destes métodos:

  • Clique em Salvar modelo para salvar o pipeline do candidato como um modelo para o seu projeto para que você possa testar e implantá-lo.
  • Clique em Salvar como notebook para criar e salvar um notebook gerado automaticamente para o seu projeto. Você pode revisar o código ou executar o experimento no notebook.

Próximas etapas

Promova o modelo treinado para um espaço de implementação para que possa testá-lo com novos dados e gerar previsões.

Saiba Mais

Detalhes da implementação do autoAI