Criação de um experimento de séries temporais

Use o AutoAI para criar um experimento de série temporal com o objetivo de prever atividades futuras, como preços de ações ou temperaturas, ao longo de um intervalo de datas ou horários especificado.

Visão geral das séries temporais

Uma análise de séries temporais é um método de previsão que utiliza observações históricas para prever valores futuros. A experiência cria automaticamente vários pipelines utilizando modelos de aprendizado de máquina, como regressão de floresta aleatória e máquinas de vetores de suporte (SVMs), bem como modelos estatísticos de séries temporais, como ARIMA e Holt-Winters. Em seguida, o experimento recomenda o melhor pipeline com base no desempenho avaliado em um conjunto de dados de validação ou em conjuntos de dados de backtest.

Ao contrário de um experimento padrão do AutoAI, que cria um conjunto de pipelines até a conclusão e depois os classifica. Uma experiência com séries temporais avalia os pipelines numa fase inicial do processo e apenas conclui e testa os pipelines com melhor desempenho.

AutoAI processo de geração de pipelines de séries temporais

Para obter detalhes sobre as várias etapas do treinamento e teste de um experimento de séries temporais, consulte Detalhes da implementação de séries temporais.

Utilização de características de apoio para melhorar as previsões

Ao configurar seu experimento de série temporal, você pode optar por especificar características de apoio, também conhecidas como características exógenas. As características de apoio são aquelas que influenciam ou fornecem contexto ao alvo da previsão. Por exemplo, se você estiver fazendo uma previsão das vendas de sorvete, a temperatura diária seria uma característica de apoio lógica que tornaria a previsão mais precisa.

Aproveitando valores futuros para recursos de suporte

Se você souber os valores futuros das características de apoio, poderá aproveitá-los ao implementar o modelo. Por exemplo, se você estiver treinando um modelo para prever as vendas futuras de camisetas, pode incluir descontos promocionais como uma característica de apoio para melhorar a previsão. Ao inserir o valor futuro da promoção, a previsão fica mais precisa.

Requisitos de dados

Estes são os requisitos atuais de dados para treinar um experimento de séries temporais:

  • Os dados de treinamento devem estar em um único arquivo no formato d CSV.

  • O arquivo deve conter uma ou mais colunas de séries temporais e, opcionalmente, uma coluna de carimbo de data/hora. Para obter uma lista dos formatos de data e hora compatíveis, consulte os detalhes da implementação de séries temporais em AutoAI.

  • Se a fonte de dados contiver uma coluna de carimbo de data/hora, certifique-se de que os dados sejam amostrados com frequência uniforme. Ou seja, a diferença entre os carimbos de data/hora das linhas adjacentes é a mesma. Por exemplo, os dados podem ser apresentados em intervalos de 1 minuto, 1 hora ou 1 dia. O carimbo de data/hora especificado é usado para determinar a janela de análise retrospectiva, a fim de melhorar a precisão do modelo.

    Observação:

    Se o tamanho do arquivo for superior a 1 GB, ordene os dados em ordem decrescente por data e hora, e apenas o primeiro 1 GB será usado para treinar o experimento.

  • Se a fonte de dados não contiver uma coluna de data e hora, certifique-se de que os dados sejam coletados em intervalos regulares e classificados em ordem crescente de acordo com a data e hora da coleta. Ou seja, o valor na primeira linha é o mais antigo, e o valor na última linha é o mais recente.

    Observação: Se o tamanho do arquivo for superior a 1 GB, reduza-o para que fique com menos de 1 GB.
  • Selecione quais dados usar no treinamento dos pipelines finais. Se você optar por incluir apenas os dados de treinamento, os notebooks gerados incluirão uma célula para recuperar os dados de validação usados para avaliar cada pipeline.

Selecione os dados do seu projeto ou faça o upload a partir do seu sistema de arquivos ou do navegador de recursos e, em seguida, clique em Continuar. Clique no ícone de alt="AutoAI ícone de visualização do conjunto de dados"visualização, ao lado do nome da fonte de dados, para revisar seus dados. Opcionalmente, você pode adicionar um segundo arquivo como dados de validação para testar os pipelines treinados.

Escolhendo uma configuração de computação

Ao configurar seu experimento, você pode escolher uma configuração de computação que forneça os recursos de computação necessários para o seu experimento. A configuração que você escolher determina quantas variáveis de previsão e características de apoio seu experimento pode ter.

Configuração do computador Recursos Limites
Médio 4 núcleos e 16 GB até 5 colunas de previsão e de características de apoio
Grande CPU de 8 núcleos e 32 GB até 10 colunas de previsão e de características de apoio
Muito grande CPU de 16 núcleos e 64 GB até 20 colunas de previsão e de características de apoio

Configurando um experimento de séries temporais

Ao configurar os detalhes de um experimento, clique em Sim para ativar a série temporal e preencha os detalhes do experimento.

Campo Descrição
Colunas de previsões As colunas da série temporal que você deseja prever com base nos valores anteriores. Você pode especificar uma ou mais colunas para previsão.
Coluna de data/hora A coluna que indica a data e a hora em que os valores da série temporal ocorrem.
Período de análise Um parâmetro que indica quantos valores da série temporal anterior são utilizados para prever o ponto temporal atual.
Janela de previsão O intervalo que você deseja prever com base nos dados da janela de análise.

O resumo da previsão mostra o tipo de experimento e a métrica selecionada para otimizar o experimento.

Configurando as definições do experimento

Para definir mais detalhes para seu experimento de série temporal, clique em “Configurações do experimento ”.

Configurações gerais de previsão

No painel Geral das configurações de previsão, você pode, se desejar, alterar a métrica usada para otimizar o experimento, especificar os algoritmos a serem considerados ou definir o número de pipelines a serem gerados.

Campo Descrição
Tipo de predição Visualize ou altere o tipo de previsão com base na coluna de previsão do seu experimento. Para experimentos com séries temporais, a opção “Previsão de séries temporais” é selecionada por padrão.
Observação: Se você alterar o tipo de previsão, as demais configurações de previsão do seu experimento serão alteradas automaticamente.
Métrica otimizada Visualize ou altere a métrica otimizada recomendada para o seu experimento.
Seleção otimizada de algoritmos Não é compatível com experimentos de séries temporais.
Algoritmos a incluir Selecione os algoritmos com base nos quais deseja que seu experimento crie pipelines. Os algoritmos e fluxos de trabalho que suportam o uso de características de apoio são indicados por uma marca de seleção.
Oleodutos a serem concluídos Visualize ou altere o número de pipelines a serem gerados para o seu experimento.

Detalhes da configuração da série temporal

No painel "Série temporal" das configurações de previsão, defina os detalhes sobre como treinar o experimento e gerar previsões.

Campo Descrição
Coluna de data/hora Visualizar ou alterar a coluna de data/hora do experimento.
Período de análise Visualizar ou atualizar o número de valores da série temporal anterior utilizados para prever o ponto temporal atual.
Janela de previsão Visualize ou atualize o intervalo no qual você deseja basear a previsão.

Configurando as definições da fonte de dados

Para definir os detalhes dos seus dados de entrada, clique em “Configurações do experimento” e selecione “Fonte de dados ”.

Configurações gerais da fonte de dados

No painel Geral das configurações da fonte de dados, você pode modificar seu conjunto de dados para interpolar valores ausentes, dividir seu conjunto de dados em dados de treinamento e de validação, e inserir características de apoio.

Campo Descrição
Linhas duplicadas Não é compatível com experimentos de séries temporais.
Dados da subamostra Não é compatível com experimentos de séries temporais.
Engenharia de características de texto Não é compatível com experimentos de séries temporais.
Processamento de data e hora Ativado por padrão para detectar a coluna de data e adicionar novas colunas para diferentes tipos de agregações de formatos de data e hora. Normalmente, você não desativaria essa opção, a menos que quisesse usar uma coluna de data/hora como um identificador (ID), em vez de como um valor de data/hora.
Conjunto de dados de treinamento final Selecione quais dados usar no treinamento dos pipelines finais: apenas os dados de treinamento ou os dados de treinamento e os dados de validação. Se você optar por incluir apenas os dados de treinamento, os notebooks gerados para este experimento incluirão uma célula para recuperar os dados de validação usados para avaliar cada pipeline.
Recursos de suporte Selecione colunas adicionais do seu conjunto de dados como características de apoio para fundamentar as previsões e aumentar a precisão do seu modelo. Você também pode usar valores futuros para recursos de apoio ativando a opção “Utilizar valores futuros de recursos de apoio ”.
Observação: você só pode usar os recursos de suporte com determinados algoritmos e pipelines. Para obter mais informações sobre algoritmos e pipelines que oferecem suporte ao uso de recursos auxiliares, consulte os detalhes de implementação de séries temporais.
Imputação de dados Use a imputação de dados para substituir os valores ausentes no seu conjunto de dados por valores substitutos. Ao ativar esta opção, você pode especificar como os valores ausentes devem ser interpolados nos seus dados. Para saber mais sobre imputação de dados, consulte “Imputação de dados em experimentos do AutoAI ”.
Dados de treinamento e de validação Reserve uma parte do seu conjunto de dados de treinamento para testar o experimento. Você pode especificar os dados de validação como uma porcentagem dos dados de treinamento ou como um número de linhas de dados. Os dados de validação não devem exceder um terço dos dados de treinamento. Como alternativa, você pode enviar um arquivo separado com os dados de validação. O arquivo de dados de validação deve corresponder ao esquema dos dados de treinamento.

Configuração de dados de séries temporais

Para configurar os dados de séries temporais, você pode ajustar as configurações dos dados de séries temporais relacionados ao backtesting do experimento. O backtesting oferece uma forma de validar um modelo de séries temporais utilizando dados históricos.

Em um experimento típico de aprendizado de máquina, é possível reservar aleatoriamente uma parte dos dados para testar a precisão do modelo resultante. Para validar um modelo de série temporal, é necessário preservar a relação de ordem temporal entre os dados de treinamento e os dados de teste.

As etapas a seguir descrevem o método de backtest:

  1. O tamanho do conjunto de dados de treinamento é determinado com base no número de backtests, no comprimento do intervalo e no tamanho do conjunto de validação. Para saber mais sobre esses parâmetros, consulte “Criação de um experimento de série temporal ”.
  2. Começando pelos dados mais antigos, o modelo é treinado utilizando os dados de treinamento.
  3. A experiência é avaliada no primeiro conjunto de dados de validação. Se o comprimento do intervalo for diferente de zero, todos os dados contidos nesse intervalo serão ignorados.
  4. A janela de dados de treinamento é atualizada aumentando o tamanho da amostra de validação e o intervalo entre amostras para formar um novo conjunto de treinamento.
  5. Um novo modelo é treinado com esses novos dados e avaliado com o próximo conjunto de dados de validação.
  6. Os dois passos anteriores são repetidos para os demais períodos de backtesting.

Para ajustar a configuração do backtesting:

  1. Abra as configurações do Experimento.
  2. Em “Fontes de dados ”, clique em “Série temporal ”.
  3. (Opcional): Ajuste as configurações conforme mostrado na tabela.
Campo Descrição
Número de backtests O backtesting é semelhante à validação cruzada para períodos de data e hora. Opcionalmente, personalize o número de backtests para o seu experimento.
Validação O tamanho do conjunto de teste e de cada conjunto de validação para o backtesting. O comprimento da validação pode ser ajustado alterando-se o comprimento do conjunto de teste.
Comprimento do intervalo O número de pontos temporais entre o conjunto de dados de treinamento e o conjunto de dados de validação para cada backtest. Quando o valor do parâmetro for diferente de zero, os valores da série temporal na lacuna não serão utilizados para treinar o experimento nem para avaliar o backtest atual.

Configurações do experimento na página "Fonte de dados"

A visualização das configurações ilustra o fluxo do backtesting. O gráfico é interativo, portanto, você pode ajustar as configurações diretamente no gráfico ou nos campos de configuração. Por exemplo, ao ajustar o comprimento do intervalo, é possível visualizar os resultados da validação do modelo em períodos anteriores dos dados sem aumentar o número de backtests.

Interpretação dos resultados do experimento

Depois de executar seu experimento de séries temporais, você pode examinar os pipelines resultantes para obter informações sobre os detalhes do experimento. Os pipelines que utilizam recursos de suporte são identificados pela tag de aprimoramento SUP, a fim de diferenciá-los dos pipelines que não utilizam esses recursos. Para ver os detalhes:

  • Passe o mouse sobre os nós na visualização para obter detalhes sobre os pipelines à medida que são gerados.
  • Alterne para a visualização do Mapa de Progresso para ver uma perspectiva diferente do processo de treinamento. Você pode passar o mouse sobre cada nó do processo para ver os detalhes.
  • Depois que os últimos pipelines forem concluídos e registrados na tabela de classificação, você poderá clicar em um pipeline para ver os detalhes de desempenho.
  • Clique em “Ver pipelines descartados” para visualizar os algoritmos utilizados nos pipelines que não foram selecionados como os de melhor desempenho.
  • Salve o código do experimento como um notebook para que você possa consultá-lo posteriormente.
  • Salve um pipeline específico como um notebook para que você possa consultá-lo.

Assista a este vídeo para ver como realizar um experimento de séries temporais e criar um modelo em um notebook Jupyter usando dados de treinamento e de validação.

Este vídeo oferece uma maneira visual de aprender os conceitos e tarefas apresentados nesta documentação.

Próximas etapas

Recursos adicionais

Próximas etapas