Construindo um experimento de série temporal

Use AutoAI para criar um experimento de série temporal para prever a atividade futura, como preços de ações ou temperaturas, em um intervalo de data ou hora especificado

Visão geral de série temporal

Um experimento de série temporal é um método de previsão que usa observações históricas para prever valores futuros. O experimento constrói automaticamente muitos pipelines usando modelos de aprendizado de máquina, como regressão de floresta aleatória e Support Vector Machines (SVMs), bem como modelos de séries temporais estatísticas, como ARIMA e Holt-Winters. Em seguida, o experimento recomenda o melhor pipeline de acordo com o desempenho do pipeline avaliado em um conjunto de dados holdout ou conjuntos de dados backtest.

Ao contrário de um experimento AutoAI padrão, que constrói um conjunto de pipelines para conclusão, em seguida, classifica-os. Um experimento de série temporal avalia pipelines anteriormente no processo e apenas conclui e testa os pipelines de melhor desempenho..

Processo de geração de pipeline de séries de tempo AutoAI

Para obter detalhes sobre as várias etapas de treinar e testar um experimento de série temporal, consulte Detalhes de implementação da série temporal.

Como usar recursos de suporte para melhorar as previsões

Ao configurar seu experimento de séries temporais, você pode optar por especificar features suportando, também conhecidas como recursos exógenos. Recursos de suporte são recursos que influenciam ou incluem contexto no destino de predição. Por exemplo, se você estiver prevendo vendas de sorvetes, a temperatura diária seria um recurso de suporte lógico que tornaria a previsão mais precisa.

Alavancando valores futuros para recursos de apoio

Se você souber os valores futuros para os recursos de suporte, será possível utilizar esses valores futuros ao implementar o modelo. Por exemplo, se você está treinando um modelo para prever vendas futuras de camisetas, você pode incluir descontos promocionais como recurso de suporte para apriviver a previsão. Inserir o valor futuro da promoção torna a previsão mais precisa.

Requisitos de Dados

Estes são os requisitos atuais de dados para treinar um experimento de séries temporais:

  • Os dados de treinamento devem ser um arquivo único no formato CSV.

  • O arquivo deve conter uma ou mais colunas de série temporal e, opcionalmente, conter uma coluna de registro de data e hora. Para obter uma lista de formatos de data / hora suportados, consulte AutoAI detalhes de implementação de séries temporais

  • Se a origem de dados contiver uma coluna de registro de data e hora, assegure que os dados sejam amostrados na frequência uniforme. Ou seja, a diferença em registros de data e hora de linhas adjacentes é a mesma. Por exemplo, os dados podem estar em incrementos de 1 minute, 1 hora, ou um dia. O timestamp especificado é usado para determinar a janela de lookback para melhorar a precisão do modelo.

    Nota:

    Se o tamanho do arquivo for maior que 1 GB, classifique os dados em ordem decrescente pelo registro de data e hora e somente os primeiros 1 GB serão usados para treinar o experimento...

  • Se a origem de dados não contiver uma coluna de registro de data e hora, assegure que os dados sejam amostrados em intervalos regulares e classificados em ordem crescente de acordo com a data / hora da amostra. Ou seja, o valor na primeira linha é o mais antigo, e o valor na última linha é o mais recente.

    Nota: Se o tamanho do arquivo for maior que 1 GB, trunque o arquivo para que ele seja menor que 1 GB.
  • Selecione quais dados usar ao treinar os pipelines finais. Se você optar por incluir somente dados de treinamento, os blocos de notas gerados incluirão uma célula para recuperação dos dados de validação usados para avaliar cada pipeline.

Escolha dados de seu projeto ou faça upload deles de seu sistema de arquivos ou do navegador do ativo, em seguida, clique em Continuar. Clique no ícone Visualizar alt="AutoAI ícone de visualização do conjunto de dados", após o nome da fonte de dados, para revisar seus dados. Opcionalmente, é possível incluir um segundo arquivo como dados de validação para testar os pipelines treinados

Configurando um experimento de série temporal

Ao configurar os detalhes para um experimento, clique em Sim para Ativar séries temporais e conclua os detalhes do experimento.

Campo Descrição
Colunas de predição As colunas de série temporal que você deseja prever com base nos valores anteriores. É possível especificar uma ou mais colunas para predição.
Coluna de data/hora A coluna que indica a data/hora nas quais os valores de série temporal ocorrem.
Janela de lookback Um parâmetro que indica quantos valores de série temporal anteriores são usados para prever o momento atual.
Janela de previsão O intervalo que você deseja prever com base nos dados na janela de lookback.

O resumo de predição mostra o tipo de experimento e a métrica selecionada para otimizar o experimento.

Configurando configurações do experimento

Para configurar mais detalhes para seu experimento de séries temporais, clique em Configurações do experimento.

Configurações gerais de predição

No painel Geral para configurações de predição, é possível opcionalmente alterar a métrica usada para otimizar o experimento ou especificar os algoritmos a serem considerados ou o número de pipelines a serem gerados.

Campo Descrição
Tipo de predição Visualize ou altere o tipo de predição com base na coluna de predição para o seu experimento. Para experimentos de séries temporais, a previsão da série Time é selecionada por padrão.
Nota: se você alterar o tipo de predição, outras configurações de predição para seu experimento serão alteradas automaticamente.
Métrica otimizada Visualize ou altere a métrica otimizada recomendada para o seu experimento.
Seleção de algoritmo otimizada Não suportado para experimentos de séries temporais.
Algoritmos a serem incluídos Selecione algoritmos com base nos quais você deseja que seu experimento crie pipelines. Algoritmos e oleodutos que suportam o uso de recursos de suporte, são indicados por um visto.
Pipelines para conclusão Visualize ou altere o número de gasodutos para gerar para o seu experimento.

Detalhes da configuração de série temporal

Na pane da série Time para configurações de predição, configure os detalhes para como treinar o experimento e gerar previsões.

Campo Descrição
Coluna de data/hora Visualize ou mude a coluna de data/hora para o experimento.
Janela de lookback Visualize ou atualize o número de valores de série temporal anteriores usados para prever o momento atual.
Janela de previsão Visualize ou atualize o intervalo que você deseja prever com base.

Configurando configurações de origem de dados

Para configurar detalhes para seus dados de entrada, selecione Configurações de Experimento e selecione Origem de Dados.

Configurações gerais de origem de dados

No painel Geral para configurações de origem de dados, é possível modificar seu conjunto de dados para interpolar valores omissos, dividir seu conjunto de dados em dados de treinamento e de validação e inserir recursos de suporte.

Campo Descrição
Linhas duplicadas Não suportado para experimentos de séries temporais.
Dados de subamostra Não suportado para experimentos de séries temporais.
Engenharia de recurso de texto Não suportado para experimentos de séries temporais.
Processamento de data / horário Ativado por padrão para detectar a coluna de data e adicionar novas colunas para diferentes tipos de agregações de formato de data/hora. Normalmente, você não desativaria essa opção, a menos que quisesse usar uma coluna de data/hora como um ID em vez de um valor de data/hora.
Conjunto de dados de treinamento final Selecione quais dados utilizar ao treinar os pipelines finais: apenas os dados de treinamento ou os dados de treinamento e holdout. Se você optar por incluir apenas dados de treinamento, os notebooks gerados para este experimento incluirão uma célula para recuperação dos dados de holdout usados para avaliar cada pipeline.
Recursos de apoio Escolha colunas adicionais do seu conjunto de dados como recursos de Suporte para suportar previsões e aumentar a exatidão do seu modelo. Você também pode usar valores futuros para recursos de Suportes, ativando Alavancar valores futuros de recursos de suporte.
Nota: é possível usar somente recursos de suporte com algoritmentos e pipelines selecionados... Para obter mais informações sobre algoritmos e pipelines que suportam o uso de recursos de suporte, consulte Detalhes da implementação de séries temporais
Imputação de dados Use a imputação de dados para substituir valores ausentes em seu dataset com valores substitutos. Ao ativar esta opção, você pode especificar como os valores ausentes devem ser interpolados em seus dados. Para saber mais sobre imputação de dados, veja a imputação de dados em experimentos AutoAI .
Dados de treinamento e de validação Opte por reservar alguns dados do seu conjunto de dados de treinamento para testar o experimento. Você pode especificar os dados de holdout como uma porcentagem dos dados de treinamento ou como um número de linhas de dados. Os dados de retenção não devem exceder um terço dos dados de treinamento. Como alternativa, você pode carregar um arquivo separado de dados de retenção. O arquivo de dados de validação deve corresponder ao esquema dos dados de treinamento.

Configurando dados de série temporal

Para configurar os dados da série temporal, você pode ajustar as configurações para os dados da série temporal que está relacionada ao backtesting o experimento. Backtesting fornece um meio de validar um modelo de série temporal usando dados históricos.

Em um experimento típico de aprendizado de máquina, é possível reter parte dos dados aleatoriamente para testar o modelo resultante quanto à exatidão. Para validar um modelo de série temporal, você deve preservar a relação de pedido de tempo entre os dados de treinamento e testar dados.

As etapas a seguir descrevem o método backtest:

  1. O comprimento dos dados de treinamento é determinado com base no número de backtests, comprimento da diferença e tamanho da retenção. Para saber mais sobre esses parâmetros, veja Construindo um experimento de série temporal.
  2. Partindo dos dados mais antigos, o experimento é treinado usando os dados de treinamento.
  3. O experimento é avaliado no primeiro conjunto de dados de validação. Se o comprimento do gap for diferente de zero, quaisquer dados na lacuna são ignorados sobre.
  4. A janela de dados de treinamento é avançada através do aumento do tamanho de holdout e comprimento do gap para formar um novo conjunto de treinamento.
  5. Um experimento fresco é treinado com esses novos dados e avaliado com o próximo conjunto de dados de validação.
  6. As duas etapas anteriores são repetidas para os períodos de backtesting restantes.

Para ajustar a configuração de backtest:

  1. Abra Configurações do experimento.
  2. Em Origens de Dados, clique em Série de Tempo
  3. (Opcional): Ajuste as configurações conforme mostrado na tabela.
Campo Descrição
Número de backtests O backtesting é semelhante à validação cruzada para períodos de data/hora. Opcionalmente, customize o número de backtests para o seu experimento.
Validação O tamanho do conjunto de retenção e cada conjunto de validação para backtest. O comprimento da validação pode ser ajustado ao mudar o comprimento da retenção.
Comprimento da diferença O número de momentos entre o conjunto de dados de treinamento e o conjunto de dados de validação para cada backtest. Quando o valor de parâmetro for diferente de zero, os valores de série temporal na diferença não serão usados para treinar o experimento ou avaliar o backtest atual.

Configurações do experimento na página Origem de Dados

A visualização para as configurações de configuração ilustra o fluxo de backtesting. O gráfico é interativo, assim, é possível manipular as configurações a partir do gráfico ou dos campos de configuração. Por exemplo, ao ajustar o comprimento da diferença, é possível ver os resultados da validação do modelo em períodos anteriores dos dados sem aumentar o número de backtests.

Interpretando os resultados do experimento

Depois de executar seu experimento de série temporal, é possível examinar os pipelines resultantes para obter insights sobre os detalhes do experimento. Os pipelines que usam recursos de Suporte são indicados pela tag de aprimoramento do SUP para distingui-los de dutos que não utilizam esses recursos. Para visualizar detalhes:

  • Passe o mouse sobre nós na visualização para obter detalhes sobre os pipelines enquanto eles estão sendo gerados.
  • Alterne para a visualização Mapa de progresso para ver uma visualização diferente do processo de treinamento. É possível passar o mouse sobre cada nó no processo para obter detalhes.
  • Após os pipelines finais serem concluídos e gravados na tabela de classificação, será possível clicar em um pipeline para ver os detalhes de desempenho.
  • Clique em Visualizar dutos descartados para visualizar os algoritmos que são usados para os pipelines que não são selecionados como principais executores.
  • Salve o código do experimento como bloco de notas que é possível revisar.
  • Salve um pipeline em particular como um notebook que você pode revisar.

Assista a este vídeo para ver como executar um experimento de série temporal e criar um modelo em um notebook Jupyter usando dados de treinamento e de retenção.

Este vídeo fornece um método visual para aprender os conceitos e tarefas nesta documentação.

Próximas etapas

Recursos adicionais

Próximas etapas