O que é cache de prompts?

Autor

Shalini Harkar

Lead AI Advocate

Os grandes modelos de linguagem (LLMs) são incrivelmente poderosos, mas trazem dois desafios importantes: custo e latência. Cada token processado gera uma cobrança e, quando os usuários consultam repetidamente o mesmo contexto, como um documento extenso, eles elevam os custos ao disparar processamento redundante.

Além disso, a latência associada ao processamento dessas solicitações pode comprometer a capacidade de resposta da sua aplicação, resultando em uma experiência do usuário aquém do esperado[1].O cache de prompts surge como solução central para enfrentar esses desafios.

Neste artigo, vamos explorar o que é exatamente o cache de prompts, em que ele difere do cache convencional, como ele pode ser usado em aplicações de IA e diversos casos de uso. Também veremos os benefícios e as ressalvas a considerar no cache de prompts.

O que é cache de prompts?

O cache de prompts é um método simples para melhorar a velocidade e a relação custo-benefício dos LLMs. Ele alcança essas melhorias ao armazenar as partes de um prompt que costumam permanecer inalteradas, como conteúdo instrucional ou considerações de material de referência, para que o modelo não precise reprocessar esses tokens repetidamente.

Por exemplo, quando você envia uma solicitação a um LLM (como "explique o que é inteligência artificial?"), o modelo lê o prompt inteiro para compreender e responder. Se você enviar o mesmo prompt novamente, ele repete o mesmo processamento, aumentando o tempo e o custo.

Com o cache de prompts, o modelo guarda as partes repetidas de um prompt depois da primeira solicitação. Quando você reenvia o mesmo prompt, ele recupera a resposta armazenada em vez de reprocessá-la. Esse processo torna as respostas mais rápidas, mais eficientes e mais econômicas, porque o modelo não precisa refazer o mesmo processamento para prompts idênticos.[2]

Em que o cache de prompts difere do cache convencional?

Objetivo e escopo:

  • O cache de prompts armazena prompts de LLM repetidos para evitar o reprocessamento e reduzir a latência.
  • O cache convencional armazena dados ou recursos acessados com frequência (por exemplo, páginas HTML, consultas a banco de dados, respostas de API, imagens) para tornar os acessos futuros mais rápidos.

Confiabilidade da saída:

  • O cache de prompts só funciona quando o prompt e todos os parâmetros (como temperatura, top-p e outros) permanecem exatamente iguais em todas as solicitações.
  • O cache convencional é determinístico, ou seja, a mesma entrada sempre produz a mesma saída (por exemplo, os mesmos resultados de consulta ou as mesmas imagens).

Desempenho:

  • O cache de prompts reduz o uso de tokens, o custo de API e a latência de ponta a ponta em solicitações de LLM repetidas ou semelhantes.
  • O cache convencional melhora o desempenho da aplicação, diminui a carga do backend ou do banco de dados e reduz a latência de rede.

Expiração e invalidação:

  • O cache de prompts costuma estar atrelado a atualizações de versão do modelo ou a ciclos de retreinamento.
  • O cache convencional gerencia isso com TTL (tempo de vida), versionamento ou invalidação manual quando os dados subjacentes mudam.[3]

Como funciona o cache de prompts?

No cache de prompts, as seções repetidas de um prompt são armazenadas para que possam ser reutilizadas em solicitações futuras, o que dispensa reenviá-las e reprocessá-las.

Veja o guia passo a passo de como isso funciona:

  1. Geração da chave: quando um prompt é enviado, o sistema cria uma chave de cache.
    O cache por correspondência exata usa o texto do prompt (ou uma forma normalizada ou com hash) e pode incluir parâmetros como nome do modelo, temperatura ou prompt de sistema. Ele só funciona quando o prompt e todas as configurações são idênticos.
    O cache semântico, por sua vez, gera um embedding do prompt e busca entradas semanticamente semelhantes. Esse tipo de cache permite a reutilização mesmo que a redação mude.Esses dois métodos de cache são abordagens distintas, com pontos fortes diferentes.
  2. Consulta ao cache: a chave ou o embedding é então verificado no repositório de cache, normalmente um repositório de chave-valor, no caso de um cache mais tradicional, ou um banco de dados de vetores, para correspondências semânticas.
  3. Acerto e falha de cache: um acerto de cache retorna imediatamente um resultado armazenado, evitando o reprocessamento. Na falha de cache, o prompt é enviado ao modelo e a saída é salva para a próxima vez.
  4. Armazenamento do resultado: em caso de falha de cache, assim que o LLM retorna uma resposta, a saída gerada (e, às vezes, o embedding ou outros metadados) é salva com essa chave para uso futuro.
  5. Invalidação: as entradas de cache podem expirar com base no tempo de vida (TTL) definido pelo servidor, na atualização do modelo ou no desvio de conteúdo, para manter as respostas precisas e atualizadas.

Como implementar o cache de prompts em LLMs

O LangChain oferece um framework flexível para adicionar o cache de prompts a aplicações de LLM. Diferentemente dos sistemas de cache independentes, o LangChain é um framework integrado para criar aplicações de LLM. Ele reúne, em uma única solução, o cache e outros componentes necessários, como encadeamento, memória, geração aumentada de recuperação (RAG) e integração de ferramentas.

Para saber mais sobre como implementar o cache de prompts com o LangChain, clique no link a seguir:

Casos de uso

  • Portais interativos de documentação: o cache de prompts é altamente eficaz em sistemas internos de gestão do conhecimento, pois armazena respostas a consultas frequentes sobre políticas organizacionais, procedimentos ou documentação técnica. Quando os funcionários buscam informações semelhantes repetidas vezes, as respostas em cache dão um retorno instantâneo, sem exigir uma nova consulta ao LLM a cada vez.

  • Campanhas de marketing: o cache de prompts agiliza os sistemas de chatbot e de automação ao calcular previamente e salvar as respostas às perguntas frequentes. Por exemplo, consultas sobre descontos, especificações de produtos ou disponibilidade em estoque são transmitidas para garantir que os usuários recebam respostas rápidas às dúvidas mais comuns. Em períodos de tráfego intenso de usuários, as respostas em cache ajudam a evitar chamadas desnecessárias ao LLM, o que reduz custos supérfluos de API e diminui a latência.

  • Sistemas de suporte ao cliente: nos canais de suporte em que os clientes podem enviar perguntas, as respostas às dúvidas comuns sobre resolução de problemas, gerenciamento de conta ou cobrança podem se tornar prompts armazenados em cache. Isso resultaria em respostas mais rápidas, consistência entre elas e menor dependência do processamento do LLM para os mesmos tipos de dúvida. Essas melhorias podem gerar ganhos de eficiência e maior satisfação do cliente.[4]

Vantagens

  • Redução de custos: economize nos custos de API ao reutilizar pares de prompt e resposta em vez de chamar o LLM várias vezes.
  • Velocidade: a resposta em cache é entregue de imediato. Isso economiza o tempo total de processamento da consulta e melhora o tempo de resposta.
  • Uso inteligente de recursos: não desperdice capacidade computacional sem necessidade e reserve recursos para executar outras consultas, variadas e complexas.
  • Capacidade infinita: lide bem com o tráfego intenso e as consultas repetidas, mantendo a aplicação funcionando com fluidez à medida que escala.
  • Respostas consistentes: todas as consultas idênticas ou semelhantes produzem a mesma resposta, vez após vez, a partir de um sinal, o que cria experiências estáveis e confiáveis para o usuário.
  • Experiência do usuário: poder oferecer respostas mais rápidas e previsíveis gera interações mais fluidas e usuários mais satisfeitos em uma aplicação voltada ao cliente.
  • Menor carga de trabalho do servidor: reduza essa carga e permita que seu sistema opere com mais eficiência ao tirar do servidor as consultas que podem ser atendidas com uma resposta em cache.[5]

Plataformas de destaque usam repositórios de cache de prompts com gravações de cache e gestão de retenção, enquanto aplicam TTL e controle de cache para gerenciar suas saídas e respeitar as taxas, garantindo a privacidade dos dados e adotando preços ou custos relacionados ao cache. Esquemas de embedding e instruções de sistema podem ser armazenados em cache para uso em interações em tempo real, o que melhora a usabilidade da ferramenta em várias conversas de múltiplos turnos.

Pontos a considerar no cache de prompts

Embora o cache de prompts possa trazer benefícios relevantes, é importante ficar atento às limitações relacionadas à otimização e ao desempenho. Estes são alguns pontos essenciais:

  • Gestão de consultas dinâmicas ou sensíveis ao contexto: embora o cache de prompts costume ter utilidade limitada para consultas dinâmicas (no tempo ou a partir de entradas anteriores do usuário) ou sensíveis ao contexto, como consultas que podem incorporar atualizações de dados em tempo real ou uma conversa de múltiplos turnos repetida, essas consultas precisam produzir uma resposta que reaja às novas informações.
  • Respostas desatualizadas: as respostas em cache podem ficar desatualizadas rapidamente se os dados ou o contexto mudarem, o que resultaria em informações incorretas ou irrelevantes em resposta a uma consulta.
  • Complexidade em casos extremos: modificar o cache para permitir a reutilização parcial do prompt, ou para mitigações específicas, pode causar mais problemas, já que essas mudanças aumentam a complexidade do design do sistema e o esforço de implementação.
  • Desafios na manutenção do cache: a gestão eficaz do cache (por exemplo, configurações de expiração ou limites de armazenamento) pode trazer sobrecarga operacional.[6][7]

Resumo

O cache de prompts é uma estratégia inteligente de cache que aprimora o desempenho de sistemas impulsionados por IA, como chatbots, assistentes de programação e pipelines de RAG, para melhorar tanto o desempenho quanto a eficiência. Em vez de enviar várias solicitações à API com a mesma requisição do prompt completo ou do prompt de sistema, o sistema aproveita o conteúdo em cache (por exemplo, prefixos de prompt, prefixos de cache, conteúdo estático) para representar esses dados, economizando tanto em tokens de entrada quanto em tokens de saída.

O resultado é uma redução no número de chamadas de API, menos falhas de cache e uma redução geral significativa na latência de resposta e na experiência do usuário.

O cache de prompts funciona melhor para o que é intrínseco a sistemas impulsionados por IA, como chatbots; ele aprimora o desempenho ao aproveitar as mensagens dos usuários, reduzir as solicitações de API e aumentar drasticamente as taxas de acerto de cache com uma leitura de cache concisa.

Para executar uma função ou responder a solicitações ou consultas subsequentes na sua aplicação, o cache de prompts economiza tokens de prompt, o total de tokens e as contagens de tokens, além de facilitar o acompanhamento das métricas. Com o cache de prompts, as equipes conseguem acompanhar os tokens de prompt e o total de tokens em tempo real e continuar escalando os LLMs com custo, velocidade e confiabilidade no tempo certo, em âmbito global, para casos de uso de IA generativa.

Referências

[1] Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling Laws for Neural Language Models. arXiv

[2] Gim, I., Chen, G., Lee, S., Sarda, N., Khandelwal, A., & Zhong, L. (2024). Prompt Cache: Modular Attention Reuse for Low-Latency Inference. Proceedings of the 7th Annual Conference on Machine Learning and Systems (MLSys 2024). Santa Clara, CA.

[3] OpenAI. “Prompt Caching.” Documentação da plataforma da OpenAI, OpenAI, acessível em https://platform.openai.com/docs/guides/prompt-caching

[4] Gu, C., Li, X. L., Kuditipudi, R., Liang, P., & Hashimoto, T. (2025). Auditing Prompt Caching in Language Model APIs. arXiv. https://arxiv.org/abs/2502.07776

[5] Kelly, Conor. Prompt Caching: Reducing latency and cost over long prompts. Blog Humanloop, 2 de outubro de 2024, https://humanloop.com/blog/prompt-caching

[6] Chakraborty, S., Zhang, X., Bansal, C., Gupta, I., & Nath, S. (2025). Generative Caching for Structurally Similar Prompts and Responses.

[7] Wu, G., Zhang, Z., Zhang, Y., Wang, W., Niu, J., Wu, Y., & Zhang, Y. (2025). I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving. Proceedings of the Network and Distributed System Security Symposium (NDSS)

Soluções relacionadas
IBM watsonx Orchestrate

Projete assistentes e agentes de IA escaláveis com facilidade, automatize tarefas repetitivas e simplifique processos complexos com o IBM watsonx Orchestrate.

Explore o watsonx Orchestrate
Soluções de inteligência artificial

Coloque a IA em ação na sua empresa com a experiência em IA líder do setor e com o portfólio de soluções da IBM.

Explore as soluções de IA
Consultoria e serviços em inteligência artificial

Os serviços de IA da IBM Consulting ajudam a reimaginar a forma como as empresas trabalham com a IA para gerar transformação.

Explore os serviços de IA
Dê o próximo passo

Seja para personalizar aplicativos e habilidades pré-construídos ou para desenvolver e implementar serviços agênticos personalizados com um estúdio de IA, a plataforma IBM watsonx oferece tudo o que você precisa.

  1. Explore o watsonx Orchestrate
  2. Explore as soluções de IA