Imputação de dados em experimentos de AutoAI

A imputação de dados é o meio de substituir valores omissos em seu conjunto de dados por valores substitutos. Se você ativar a imputação, será possível especificar como os valores omissos são interpolados em seus dados

Imputação por tipo de experiência

Os métodos de imputação dependem do tipo de experimento que você constrói.

  • Para classificação e regressão, é possível configurar métodos de imputação categóricos e numéricos.
  • Para problemas de timeseries, você pode escolher a partir de um conjunto de métodos de imputação para aplicar em colunas numéricas. Quando o experimento é executado, o método de melhor desempenho do conjunto é aplicado automaticamente. Também é possível especificar um valor específico como um valor de substituição.

Ativando a imputação

Para visualizar e configurar opções de imputação:

  1. Clique em Configurações do experimento ao configurar o seu experimento.
  2. Clique na opção Origem de dados.
  3. Clique em Ativar imputação de dados. Note que se você não ativar explicitamente a imputação de dados, mas sua origem de dados tiver valores omissos, o AutoAI avisará e aplicará os métodos de imputação padrão. Consulte detalhes de imputação.
  4. Selecione opções na seção Imputação.
  5. Configure, opcionalmente, um limite para a porcentagem de imputação aceitável para uma coluna de dados. Se a porcentagem de valores ausentes exceder o limite especificado, o experimento falhará. Para resolver, atualize a origem de dados ou ajuste o limite.

Configurando a imputação para experimentos de classificação e de regressão

Escolha um desses métodos para imputar dados omissos em classificação binária, classificação multiclasse ou experimentos de regressão. Note que você pode ter um método para completar valores para dados baseados em texto (categóricos) e outro para dados numéricos.

Método Descrição
Mais frequente Substitua o valor ausente pelo valor que aparece com mais frequência na coluna.
Mediana Substitua o valor omisso pelo valor no meio da coluna classificada.
Média Substitua o valor omisso pelo valor médio da coluna.

Configurando a imputação para experimentos de séries temporais

Escolha alguns ou todos esses métodos. Quando vários métodos são selecionados, o método de melhor desempenho é aplicado automaticamente para o experimento..

Nota: a imputação não é suportada para valores de data ou hora.
Método Descrição
Cúbico Utiliza interpolação cúbica usando método de pandas / scipy para preencher valores ausentes.
Preenchimento Escolha value como o tipo para substituir os valores omissos por um valor numérico que você especificar.
Flatten Iterative Os dados são primeiramente comprimidos e, em seguida, o imputador iterativo Scikit-learn é aplicado para encontrar valores omissos.
Linear Use interpolação linear usando método de pandas / scipy para preencher valores ausentes.
Avançar Substitua o valor omisso pelo próximo valor.
Prévio Substitua o valor omisso pelo valor anterior.

Próximas etapas

Detalhes da implementação de imputação de dados para experimentos de séries temporais