Les grands modèles de langage (LLM) sont incroyablement puissants, mais ils présentent deux inconvénients majeurs : le coût et la latence. Chaque token traité engendre un coût, et lorsque les utilisateurs interrogent à plusieurs reprises le même contexte, comme un document volumineux, ils font grimper les coûts en déclenchant des calculs redondants.
De plus, la latence associée au traitement de ces requêtes peut nuire à la réactivité de votre application, ce qui nuit à l’expérience utilisateur[1].La mise en cache des prompts s’impose comme une solution essentielle pour relever ces défis.
Dans cet article, nous examinerons ce qu’est exactement la mise en cache des prompts, en quoi elle diffère de la mise en cache classique, comment elle peut être appliquée dans les applications d’IA, ainsi que divers cas d’utilisation. Nous aborderons également les avantages et les précautions à prendre en compte concernant cette technique.
La mise en cache des prompts est une méthode simple permettant d’améliorer la vitesse et la rentabilité des LLM. Elle consiste à stocker les parties d’un prompt qui restent souvent inchangées, telles que le contenu des instructions ou les éléments de référence, afin d’éviter au modèle de devoir retraiter ces tokens à plusieurs reprises.
Par exemple, lorsque vous envoyez une requête à un LLM (telle que « explique ce qu’est l’intelligence artificielle »), le modèle lit l’intégralité du prompt pour le comprendre et y répondre. Si vous renvoyez le même prompt, il répète le même traitement, ce qui augmente le temps et le coût.
Grâce à la mise en cache des prompts, le modèle enregistre les parties répétitives d’un prompt après la première demande. Lorsque vous renvoyez le même prompt, il récupère la réponse stockée au lieu de la retraiter. Ce processus rend les réponses plus rapides, plus efficaces et plus rentables, car le modèle n’a pas à refaire le même calcul pour des prompts identiques[2].
Objectif et portée :
Fiabilité des résultats :
Performances :
Expiration et invalidation :
Dans la mise en cache des prompts, les sections répétées d’un prompt sont stockées afin de pouvoir être réutilisées dans de futures requêtes, ce qui évite de devoir les renvoyer et les retraiter.
Voici les différentes étapes de son fonctionnement :
LangChain fournit un cadre flexible permettant d’intégrer la mise en cache des prompts dans les applications LLM. Contrairement aux systèmes de mise en cache autonomes, LangChain est un cadre intégré destiné à la création d’applications LLM. Il regroupe la mise en cache et d’autres composants indispensables au sein d’une solution unique, tels que l’enchaînement, la mémoire, la génération augmentée de récupération (RAG) et l’intégration d’outils.
Pour en savoir plus sur la mise en œuvre de la mise en cache des prompts à l’aide de LangChain, cliquez sur le lien suivant :
Les principales plateformes utilisent des systèmes de mise en cache des prompts grâce à l’écriture dans le cache et à la gestion de la durée de conservation, tout en recourant au TTL et au contrôle du cache pour gérer leurs sorties et respecter les limites de fréquence. Cela permet de garantir la confidentialité des données et de déterminer la tarification ou les coûts liés au cache. L’intégration de schémas et d’instructions système peut être mise en cache pour une utilisation dans le cadre d’interactions en temps réel, afin d’améliorer la facilité d’utilisation de l’outil au cours de conversations à plusieurs tours.
Bien que la mise en cache des prompts puisse présenter des avantages notables, il est important de garder à l’esprit ses limites en matière d’optimisation et de performances. Voici quelques éléments à prendre en compte :
La mise en cache des prompts est une stratégie de mise en cache intelligente qui améliore les performances et l’efficacité des systèmes pilotés par l’IA, tels que les chatbots, les assistants de codage et les pipelines RAG. Au lieu d’effectuer plusieurs requêtes vers l’API avec la même demande pour le prompt complet ou le prompt système, le système tire parti du contenu mis en cache (par exemple, les préfixes de prompts, les préfixes de cache, le contenu statique) pour représenter ces données, ce qui permet de réaliser des économies tant au niveau des tokens d’entrée que de ceux de sortie.
Il en résulte une réduction du nombre d’appels API, une diminution des miss de cache et, globalement, une amélioration significative de la latence des réponses ainsi que de l’expérience utilisateur.
La mise en cache des prompts fonctionne particulièrement bien pour les systèmes intrinsèquement alimentés par l’IA, tels que les chatbots ; elle améliore les performances en exploitant les messages des utilisateurs, en réduisant les requêtes API et en augmentant considérablement les taux hits de cache grâce à une lecture concise du cache.
Pour l’exécution d’une fonction ou la réponse à des requêtes ou demandes ultérieures dans votre application, la mise en cache des prompts enregistre les tokens de prompt, le nombre total de tokens et le décompte des tokens, tout en facilitant le suivi des indicateurs. Ainsi, les équipes peuvent suivre en temps réel les tokens de prompt et le nombre total de tokens, et continuer à déployer des grands modèles de langage à l’échelle mondiale pour les cas d’utilisation de l’IA générative, tout en optimisant les coûts, la vitesse et la fiabilité.
[1] Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling Laws for Neural Language Models. arXiv
[2] Gim, I., Chen, G., Lee, S., Sarda, N., Khandelwal, A., & Zhong, L. (2024). Prompt Cache: Modular Attention Reuse for Low-Latency Inference. Actes de la 7e conférence annuelle sur le machine learning et les systèmes (MLSys 2024). Santa Clara, Californie, États-Unis.
[3] OpenAI. « Prompt Caching ». OpenAI Platform Documentation, OpenAI, disponible sur https://platform.openai.com/docs/guides/prompt-caching
[4] Gu, C., Li, X. L., Kuditipudi, R., Liang, P., & Hashimoto, T. (2025). Auditing Prompt Caching in Language Model APIs. arXiv. https://arxiv.org/abs/2502.07776
[5] Kelly, Conor. Prompt Caching: Reducing latency and cost over long prompts. Humanloop Blog, 2 octobre 2024, https://humanloop.com/blog/prompt-caching
[6] Chakraborty, S., Zhang, X., Bansal, C., Gupta, I., & Nath, S. (2025). Generative Caching for Structurally Similar Prompts and Responses.
[7] Wu, G., Zhang, Z., Zhang, Y., Wang, W., Niu, J., Wu, Y., & Zhang, Y. (2025). I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving. Actes du Symposium sur la sécurité des réseaux et des systèmes distribués (NDSS)