Imputação de dados em experimentos de AutoAI
A imputação de dados é o meio de substituir valores omissos em seu conjunto de dados por valores substitutos. Se você ativar a imputação, será possível especificar como os valores omissos são interpolados em seus dados
Imputação por tipo de experiência
Os métodos de imputação dependem do tipo de experimento que você constrói.
- Para classificação e regressão, é possível configurar métodos de imputação categóricos e numéricos.
- Para problemas de timeseries, você pode escolher a partir de um conjunto de métodos de imputação para aplicar em colunas numéricas. Quando o experimento é executado, o método de melhor desempenho do conjunto é aplicado automaticamente. Também é possível especificar um valor específico como um valor de substituição.
Ativando a imputação
Para visualizar e configurar opções de imputação:
- Clique em Configurações do experimento ao configurar o seu experimento.
- Clique na opção Origem de dados.
- Clique em Ativar imputação de dados. Note que se você não ativar explicitamente a imputação de dados, mas sua origem de dados tiver valores omissos, o AutoAI avisará e aplicará os métodos de imputação padrão. Consulte detalhes de imputação.
- Selecione opções na seção Imputação.
- Configure, opcionalmente, um limite para a porcentagem de imputação aceitável para uma coluna de dados. Se a porcentagem de valores ausentes exceder o limite especificado, o experimento falhará. Para resolver, atualize a origem de dados ou ajuste o limite.
Configurando a imputação para experimentos de classificação e de regressão
Escolha um desses métodos para imputar dados omissos em classificação binária, classificação multiclasse ou experimentos de regressão. Note que você pode ter um método para completar valores para dados baseados em texto (categóricos) e outro para dados numéricos.
| Método | Descrição |
|---|---|
| Mais frequente | Substitua o valor ausente pelo valor que aparece com mais frequência na coluna. |
| Mediana | Substitua o valor omisso pelo valor no meio da coluna classificada. |
| Média | Substitua o valor omisso pelo valor médio da coluna. |
Configurando a imputação para experimentos de séries temporais
Escolha alguns ou todos esses métodos. Quando vários métodos são selecionados, o método de melhor desempenho é aplicado automaticamente para o experimento..
| Método | Descrição |
|---|---|
| Cúbico | Utiliza interpolação cúbica usando método de pandas / scipy para preencher valores ausentes. |
| Preenchimento | Escolha value como o tipo para substituir os valores omissos por um valor numérico que você especificar. |
| Flatten Iterative | Os dados são primeiramente comprimidos e, em seguida, o imputador iterativo Scikit-learn é aplicado para encontrar valores omissos. |
| Linear | Use interpolação linear usando método de pandas / scipy para preencher valores ausentes. |
| Avançar | Substitua o valor omisso pelo próximo valor. |
| Prévio | Substitua o valor omisso pelo valor anterior. |
Próximas etapas
Detalhes da implementação de imputação de dados para experimentos de séries temporais