Configurando um experimento de classificação ou regressão

AutoAI oferece configurações de experimento que você pode usar para configurar e personalizar seus experimentos de classificação ou regressão.

Visão geral das configurações do experimento

Depois de carregar os dados do experimento e selecionar o tipo de experimento e o que prever, AutoAI o estabelece configurações e métricas padrão para o seu experimento. Você pode aceitar esses padrões e prosseguir com o experimento ou clicar em Configurações do experimento para personalizar as configurações. Ao personalizar as configurações, você pode controlar com precisão como o experimento constrói os pipelines do modelo candidato.

Use as tabelas a seguir como guia para definir as configurações das experiências de classificação e regressão. Para obter detalhes sobre como configurar um experimento de série temporal, consulte Criando um experimento de série temporal.

Configurações de Predição

A maioria das configurações de previsão está na página principal Geral. Revise ou atualize as seguintes configurações.

Configuração Descrição
Tipo de predição Você pode alterar ou substituir o tipo de previsão. Por exemplo, se o AutoAI detectar apenas duas classes de dados e configurar um experimento de classificação binária, mas você souber que existem três classes de dados, poderá alterar o tipo para multiclasse.
Classe positiva Para experimentos de classificação binária otimizados para Precisão, Precisão Média, Recuperação ou F1, é necessária uma classe positiva. Confirme se a Classe positiva está correta ou o experimento pode gerar resultados imprecisos.
Métrica otimizada Altere a métrica para otimizar e classificar os pipelines candidatos ao modelo.
Tempo de execução otimizado Selecione como o AutoAI Runtime deve otimizar o tempo de execução do seu experimento. Se você não otimizar para o tempo de execução, AutoAI o foco será alcançar a maior precisão possível, mas seu experimento levará mais tempo para ser concluído. Se você optar pela otimização, AutoAI concentre-se mais no tempo de execução mais curto e menos na precisão. Você pode aplicar esse foco durante a seleção do algoritmo, durante o ajuste dos hiperparâmetros ou em ambas as fases para obter resultados mais rápidos.
Algoritmos a serem incluídos Selecione qual dos algoritmos disponíveis avaliar quando o experimento for executado. A lista de algoritmos é baseada no tipo de predição selecionado.
Algoritmos para usar AutoAI testa os algoritmos especificados e usa os de melhor desempenho para criar pipelines de modelos. Escolha quantos dos melhores algoritmos aplicar. Cada algoritmo gera de 4 a 5 pipelines, o que significa que, se você selecionar 3 algoritmos para usar, os resultados do seu experimento incluirão de 12 a 15 pipelines classificados. Mais algoritmos aumentam o tempo de execução do experimento.

Configurações de equidade de dados

Clique na guia “Equidade” para avaliar a equidade da sua experiência em termos de resultados previstos. Para obter detalhes sobre como configurar a detecção de imparcialidade, consulte Aplicando testes de imparcialidade a AutoAI experimentos.

Configurações de origem de dados

A guia Geral das configurações da fonte de dados oferece opções para configurar como o experimento consome e processa os dados para treinamento e avaliação do experimento.

Configuração Descrição
Dados ordenados Especifique se seus dados de treinamento são ordenados sequencialmente, de acordo com um índice de linha. Quando os dados de entrada são sequenciais, o desempenho do modelo é avaliado com base nos registros mais recentes, em vez de uma amostragem aleatória, e os dados de retenção utilizam os últimos n registros do conjunto, em vez de n registros aleatórios. Os dados sequenciais são necessários para experimentos de séries temporais, mas opcionais para experimentos de classificação e regressão.
Linhas duplicadas Para acelerar o treinamento, você pode optar por ignorar linhas duplicadas nos seus dados de treinamento.
Método de subamostra de seleção de pipeline Para um conjunto de dados grande, use um subconjunto de dados para treinar o experimento. Esta opção acelera os resultados, mas pode afetar a precisão.
Refinamento de recurso Especifique como lidar com recursos que não têm impacto no modelo. As opções são: remover sempre o recurso, removê-lo quando melhorar a qualidade do modelo ou não removê-lo. Para obter detalhes sobre como a importância dos recursos é calculada, consulte os detalhes AutoAI de implementação.
Imputação de dados Interpole os valores ausentes em sua origem de dados. Para obter detalhes sobre como gerenciar a imputação de dados, consulte Imputação de dados em AutoAI experimentos.
Utilizar processamento de data / horário Ativado por padrão para detectar colunas de data e adicionar novas colunas para diferentes tipos de agregações de formato de data/hora. Desative esta opção quando desejar usar uma coluna de data/hora como um ID, em vez de como um valor de data/hora.
Engenharia de recurso de texto Quando ativado, as colunas detectadas como texto são transformadas em vetores para analisar melhor a similaridade semântica entre as cadeias de caracteres. Ativar essa configuração pode aumentar o tempo de execução. Para obter detalhes, consulte Criando um experimento de análise de texto.
Conjunto de dados de treinamento final Selecione quais dados usar para treinar os pipelines finais. Se você optar por incluir apenas dados de treinamento, os notebooks gerados incluirão uma célula para recuperar os dados de retenção usados para avaliar cada pipeline.
Manipulação de valor discrepante Escolha se AutoAI deseja excluir valores atípicos da coluna de destino para melhorar a precisão do treinamento. Se ativado, AutoAI utiliza o método do intervalo interquartil (IQR) para detectar e excluir valores atípicos dos dados finais de treinamento, sejam eles apenas dados de treinamento ou dados de treinamento e retenção.
Método de treinamento e validação Os dados de treinamento são usados para treinar o modelo e os dados de validação são retidos do treinamento do modelo e usados para medir o desempenho do modelo. Para modelos de classificação e regressão, você pode dividir uma única fonte de dados em dados de treinamento e teste (holdout) ou usar um segundo arquivo de dados específico para os dados de teste. Se você dividir seus dados de treinamento, especifique as porcentagens a serem usadas para os dados de treinamento e os dados de teste. Os dados de retenção não devem exceder um terço dos dados de treinamento. Você também pode especificar o número de dobras, desde o padrão de três dobras até um máximo de 10. A validação cruzada divide os dados de treinamento em dobras ou grupos para teste de desempenho do modelo.
Selecionar recursos a serem incluídos Selecione colunas da sua fonte de dados que contenham dados que suportem a coluna de previsão. Excluir colunas desnecessárias pode melhorar o tempo de execução.

Configurações de tempo de execução

Revise as configurações do experimento ou altere os recursos computacionais alocados para a execução do experimento.

Próximas etapas

Configurar um experimento de análise de texto