Recomendações de cache na Data Virtualization

Usando um conjunto de consultas de entrada, Data Virtualization recomenda uma lista classificada de caches de dados que podem melhorar o desempenho das consultas de entrada e ajudar potencialmente futuras cargas de trabalho de consulta.

As consultas de entrada são aquelas que foram executadas em qualquer lugar no dia anterior até os 15 dias anteriores e devem ter um tempo de execução de pelo menos um minuto. As recomendações são consideradas válidas por 1 dia após o qual elas podem mudar conforme a carga de trabalho de consulta é alterada.

  1. O mecanismo de recomendação de cache usa dois modelos para gerar recomendações.
    • O modelo baseado em regras usa uma heurística sofisticada para determinar quais candidatos de cache ajudam a carga de trabalho de consulta de entrada.
    • O modelo baseado em aprendizado de máquina usa um modelo de aprendizado de máquina pré-treinado que detecta padrões de consulta subjacentes e prevê caches que ajudam uma potencial carga de trabalho de consulta futura.

    Ambos os modelos produzem uma lista classificada de candidatos de cache que são consolidados pelo mecanismo para gerar um conjunto final de recomendações. É possível optar por ativar ou desativar recomendações de cache baseadas em aprendizado de máquina. Por padrão, as recomendações de cache baseadas em aprendizado de máquina estão ativadas.

    Além das recomendações de criação de cache, o mecanismo também faz recomendações de desativação e exclusão de cache com base em uso passado e outras métricas. Essas recomendações aparecem na guia de cache Ativo e Inativo para caches existentes.

  2. As recomendações de cache baseadas em aprendizado de máquina consideram os padrões de consulta subjacentes e preveem caches válidos por 1 dia.

    Data Virtualization usa um modelo pré-treinado que foi treinado em um conjunto de dados padrão do setor.

    É possível optar por ativar ou desativar recomendações de cache baseadas em aprendizado de máquina.

  3. O mecanismo de recomendação consolida e classifica o conjunto final de recomendações de ambos os modelos. O Manager pode então adicionar caches de dados a partir dessas recomendações.

Data Virtualization fornece um mecanismo para gerar uma lista classificada de recomendações. A classificação das recomendações de criação de cache é determinada pelo tempo de execução das consultas, pela frequência dessas consultas na carga de trabalho de entrada e pelo peso dos dois modelos. O mecanismo está totalmente ciente e não recomenda a criação de caches já existentes. Além disso, o mecanismo não recomenda a criação de caches duplicados.

O processo de gerar recomendações de cache consiste em cinco estágios, conforme representado na imagem a seguir:

Figura 1. Visão geral do processo de recomendação de cache
Visão geral de estágios envolvidos em processo de geração de recomendações de cache

Coletar
O mecanismo de recomendação seleciona um conjunto de consultas do cliente cujo desempenho precisa ser aprimorado e para as quais os caches podem ser recomendados. O mecanismo de recomendação de cache coleta informações, como texto de consulta, tempo de execução, cardinalidade, registro de data e hora e frequência, para o período fornecido.
A imagem a seguir mostra como as consultas de carga de trabalho histórica são filtradas para chegar ao conjunto de entrada final de consultas para o mecanismo de recomendação:
Figura 2 Estágio de coleta no processo de recomendação de cache.
Coletar estágio no processo de recomendação de cache.
As definições de configuração do cache são definidas pelo Data Virtualization Manager; consulte Configurar recomendações de cache para obter detalhes.
Extract
O mecanismo de recomendação gera potenciais candidatos de cache para a carga de trabalho de consulta de entrada.
Converter
O mecanismo de recomendação converte e consolida os candidatos para assegurar que estejam sintaticamente e semanticamente corretos, exclusivos e passem todas as restrições do Db2 .
Avaliar
O mecanismo avalia as definições convertidas fazendo a correspondência de cada candidato a cache com a carga de trabalho da consulta de entrada para determinar sua eficácia, classificação e ordenação. Além disso, para pontuar o modelo de aprendizado de máquina, um vetor de recurso altamente dimensional é criado para cada candidato.
Figura 3. Estágio de avaliação no processo de recomendação de cache.
Avaliar estágio do processo para gerar recomendações de cache.
Como resultado dessa avaliação, o mecanismo de recomendação gera uma pontuação de correspondência para cada candidato. A avaliação de cada candidato baseia-se nos critérios a seguir.
  • Correspondência : Número de consultas que correspondem ao candidato do cache.
  • Diversidade : Consultas diferentes que correspondem ao candidato do cache.
  • Cardinalidade : Tamanho do conjunto de resultados que o candidato ao cache buscou.
  • Desempenho : Tempo de execução das consultas que o candidato do cache correspondeu.
Ordenação e classificação
O mecanismo de recomendação ordena e classifica os candidatos de cache para gerar uma lista final de recomendações. A lista final de recomendações é criada com base nos critérios a seguir.
  • Ordene candidatos usando uma métrica ponderada de tempo de execução e frequência de consulta correspondida.
  • Qualquer empate entre os candidatos é quebrado usando frequência e cardinalidade.
Figura 4. Estágio de ordenação e classificação no processo de recomendação de cache.
Ranking e sorteio de recomendações de cache.