大型语言模型 (LLM) 功能强大,但也面临两个主要挑战:成本和延迟。每个经过处理的词元都会产生费用,而当用户反复查询相同上下文(例如大型文档)时,会因触发重复计算而增加成本。
此外,处理这些请求所产生的延迟可能会降低应用程序的响应速度,导致用户体验不佳[1]。提示缓存成为应对这些挑战的关键解决方案。
在本文中,我们将深入了解提示缓存究竟是什么、它与传统缓存有何不同、如何将其应用于 AI 应用程序,以及各种使用场景。我们还将介绍提示缓存的优势以及需要注意的事项。
提示缓存是一种提升 LLM 速度和成本效率的简单方法。它通过存储提示词中经常保持不变的部分(例如指令内容或参考资料相关信息),避免模型反复处理这些词元,从而实现性能优化。
例如,当您向 LLM 发送请求(例如“解释什么是人工智能?”)时,模型会读取完整的提示词,以理解请求并生成响应。如果您再次发送相同的提示词,模型会重复执行相同的处理过程,从而增加时间和成本。
通过提示缓存,模型会在首次请求后保存提示词中重复出现的部分。当您再次发送相同的提示词时,模型会检索已存储的内容,而无需重新处理这些部分。这一过程可以让响应速度更快、效率更高,并降低成本,因为模型无需针对相同的提示词重复执行相同的计算过程。[2]
目标与范围:
输出可靠性:
性能:
到期和失效:
在提示缓存中,提示词中重复的部分会被存储,以便在后续请求中重复使用,从而避免重新发送和处理这些内容。
以下是其运行流程的分步指南:
LangChain 为在 LLM 应用程序中添加提示缓存提供了灵活的框架。与独立缓存系统不同,LangChain 是一个用于构建 LLM 应用程序的集成框架。它将缓存与其他必要组件整合到一个解决方案中,例如链式调用、记忆、检索增强生成 (RAG) 和工具集成。
如需了解如何使用 LangChain 实现提示缓存,请点击以下链接:
主流平台通过缓存写入和保留管理机制使用提示缓存存储,同时利用 TTL 和缓存控制机制管理输出结果并限制请求速率,确保数据隐私,并根据缓存使用情况制定相应的定价或成本策略。嵌入向量架构和系统指令也可以进行缓存,用于实时交互,从而提升跨多个多轮对话中的工具使用体验。
提示缓存是一种智能缓存策略,可提升聊天机器人、代码助手和 RAG 管道等 AI 驱动系统的性能,从而改善整体性能和效率。与多次向 API 发送包含完整提示词或系统提示词的相同请求不同,该系统利用缓存内容(例如提示词前缀、缓存前缀、静态内容)来表示这些数据,从而节省输入词元和输出词元。
其结果是减少 API 调用次数、降低缓存未命中率,并显著提升整体响应速度和用户体验。
提示缓存最适用于 AI 驱动系统中的核心场景,例如聊天机器人。它通过利用用户消息减少 API 请求,并通过简洁的缓存读取显著提高缓存命中率,从而提升系统性能。
在运行函数或响应应用程序中的后续请求或查询时,提示缓存可以节省提示词词元、总词元数量以及词元计数,同时提升指标跟踪的便捷性。借助提示缓存,团队可以实时跟踪提示词词元和总词元,并在生成式 AI 使用场景中,以合理的成本、速度和可靠性,在全球范围内持续扩展大型语言模型。
[1] Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D.(2020 年)。《Scaling Laws for Neural Language Models(神经语言模型的扩展规律)》。arXiv
[2] Gim, I., Chen, G., Lee, S., Sarda, N., Khandelwal, A., & Zhong, L.(2024 年)。《Prompt Cache: Modular Attention Reuse for Low-Latency Inference(提示缓存:用于低延迟推理的模块化注意力复用)》。第 7 届机器学习与系统年度会议 (MLSys 2024) 论文集。美国加利福尼亚州圣克拉拉。
[3] OpenAI。“提示缓存”。《OpenAI Platform Documentation(OpenAI 平台文档)》,OpenAI,访问地址:https://platform.openai.com/docs/guides/prompt-caching
[4] Gu, C., Li, X. L., Kuditipudi, R., Liang, P., & Hashimoto, T.(2025 年)。《Auditing Prompt Caching in Language Model APIs(语言模型 API 中提示缓存的审计)》。arXiv。https://arxiv.org/abs/2502.07776
[5] Kelly, Conor。《Prompt Caching: Reducing latency and cost over long prompts(提示缓存:降低长提示词的延迟和成本)》。Humanloop Blog,2024 年 10 月 2 日,https://humanloop.com/blog/prompt-caching
[6] Chakraborty, S., Zhang, X., Bansal, C., Gupta, I., & Nath, S.(2025 年)。《Generative Caching for Structurally Similar Prompts and Responses(针对结构相似提示词和响应的生成式缓存)》。
[7] Wu, G., Zhang, Z., Zhang, Y., Wang, W., Niu, J., Wu, Y., & Zhang, Y.(2025 年)。《I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving(我知道您问了什么:多租户 LLM 服务中通过 KV-Cache 共享导致的提示词泄露)》。Network and Distributed System Security Symposium (NDSS) 论文集。