Os grandes modelos de linguagem (LLMs) são incrivelmente poderosos, mas trazem dois desafios importantes: custo e latência. Cada token processado gera uma cobrança e, quando os usuários consultam repetidamente o mesmo contexto, como um documento extenso, eles elevam os custos ao disparar processamento redundante.
Além disso, a latência associada ao processamento dessas solicitações pode comprometer a capacidade de resposta da sua aplicação, resultando em uma experiência do usuário aquém do esperado[1].O cache de prompts surge como solução central para enfrentar esses desafios.
Neste artigo, vamos explorar o que é exatamente o cache de prompts, em que ele difere do cache convencional, como ele pode ser usado em aplicações de IA e diversos casos de uso. Também veremos os benefícios e as ressalvas a considerar no cache de prompts.
O cache de prompts é um método simples para melhorar a velocidade e a relação custo-benefício dos LLMs. Ele alcança essas melhorias ao armazenar as partes de um prompt que costumam permanecer inalteradas, como conteúdo instrucional ou considerações de material de referência, para que o modelo não precise reprocessar esses tokens repetidamente.
Por exemplo, quando você envia uma solicitação a um LLM (como "explique o que é inteligência artificial?"), o modelo lê o prompt inteiro para compreender e responder. Se você enviar o mesmo prompt novamente, ele repete o mesmo processamento, aumentando o tempo e o custo.
Com o cache de prompts, o modelo guarda as partes repetidas de um prompt depois da primeira solicitação. Quando você reenvia o mesmo prompt, ele recupera a resposta armazenada em vez de reprocessá-la. Esse processo torna as respostas mais rápidas, mais eficientes e mais econômicas, porque o modelo não precisa refazer o mesmo processamento para prompts idênticos.[2]
Objetivo e escopo:
Confiabilidade da saída:
Desempenho:
Expiração e invalidação:
No cache de prompts, as seções repetidas de um prompt são armazenadas para que possam ser reutilizadas em solicitações futuras, o que dispensa reenviá-las e reprocessá-las.
Veja o guia passo a passo de como isso funciona:
O LangChain oferece um framework flexível para adicionar o cache de prompts a aplicações de LLM. Diferentemente dos sistemas de cache independentes, o LangChain é um framework integrado para criar aplicações de LLM. Ele reúne, em uma única solução, o cache e outros componentes necessários, como encadeamento, memória, geração aumentada de recuperação (RAG) e integração de ferramentas.
Para saber mais sobre como implementar o cache de prompts com o LangChain, clique no link a seguir:
Plataformas de destaque usam repositórios de cache de prompts com gravações de cache e gestão de retenção, enquanto aplicam TTL e controle de cache para gerenciar suas saídas e respeitar as taxas, garantindo a privacidade dos dados e adotando preços ou custos relacionados ao cache. Esquemas de embedding e instruções de sistema podem ser armazenados em cache para uso em interações em tempo real, o que melhora a usabilidade da ferramenta em várias conversas de múltiplos turnos.
Embora o cache de prompts possa trazer benefícios relevantes, é importante ficar atento às limitações relacionadas à otimização e ao desempenho. Estes são alguns pontos essenciais:
O cache de prompts é uma estratégia inteligente de cache que aprimora o desempenho de sistemas impulsionados por IA, como chatbots, assistentes de programação e pipelines de RAG, para melhorar tanto o desempenho quanto a eficiência. Em vez de enviar várias solicitações à API com a mesma requisição do prompt completo ou do prompt de sistema, o sistema aproveita o conteúdo em cache (por exemplo, prefixos de prompt, prefixos de cache, conteúdo estático) para representar esses dados, economizando tanto em tokens de entrada quanto em tokens de saída.
O resultado é uma redução no número de chamadas de API, menos falhas de cache e uma redução geral significativa na latência de resposta e na experiência do usuário.
O cache de prompts funciona melhor para o que é intrínseco a sistemas impulsionados por IA, como chatbots; ele aprimora o desempenho ao aproveitar as mensagens dos usuários, reduzir as solicitações de API e aumentar drasticamente as taxas de acerto de cache com uma leitura de cache concisa.
Para executar uma função ou responder a solicitações ou consultas subsequentes na sua aplicação, o cache de prompts economiza tokens de prompt, o total de tokens e as contagens de tokens, além de facilitar o acompanhamento das métricas. Com o cache de prompts, as equipes conseguem acompanhar os tokens de prompt e o total de tokens em tempo real e continuar escalando os LLMs com custo, velocidade e confiabilidade no tempo certo, em âmbito global, para casos de uso de IA generativa.
[1] Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling Laws for Neural Language Models. arXiv
[2] Gim, I., Chen, G., Lee, S., Sarda, N., Khandelwal, A., & Zhong, L. (2024). Prompt Cache: Modular Attention Reuse for Low-Latency Inference. Proceedings of the 7th Annual Conference on Machine Learning and Systems (MLSys 2024). Santa Clara, CA.
[3] OpenAI. “Prompt Caching.” Documentação da plataforma da OpenAI, OpenAI, acessível em https://platform.openai.com/docs/guides/prompt-caching
[4] Gu, C., Li, X. L., Kuditipudi, R., Liang, P., & Hashimoto, T. (2025). Auditing Prompt Caching in Language Model APIs. arXiv. https://arxiv.org/abs/2502.07776
[5] Kelly, Conor. Prompt Caching: Reducing latency and cost over long prompts. Blog Humanloop, 2 de outubro de 2024, https://humanloop.com/blog/prompt-caching
[6] Chakraborty, S., Zhang, X., Bansal, C., Gupta, I., & Nath, S. (2025). Generative Caching for Structurally Similar Prompts and Responses.
[7] Wu, G., Zhang, Z., Zhang, Y., Wang, W., Niu, J., Wu, Y., & Zhang, Y. (2025). I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving. Proceedings of the Network and Distributed System Security Symposium (NDSS)