大規模言語モデル(LLM)は非常に強力ですが、コストとレイテンシーという2つの大きな課題があります。処理されるすべてのトークンには料金が発生し、ユーザーが大規模なドキュメントなどの同じコンテキストを繰り返しクエリすると、冗長な計算がトリガーされてコストが上昇します。
また、これらのリクエストの処理に伴うレイテンシーにより、アプリケーションの応答性が低下し、ユーザー・エクスペリエンスが標準以下になる可能性があります[1]。プロンプト・キャッシュは、これらの課題に対処するための重要なソリューションとして浮上しています。
この記事では、プロンプト・キャッシュとは具体的に何か、従来のキャッシュと何が違うのか、AIアプリケーションにどのように適用できるのか、そしてさまざまなユースケースについて説明します。また、プロンプト・キャッシュで考慮すべきメリットと注意事項についても説明します。
プロンプト・キャッシュは、LLMの速度とコスト効率を向上させる簡単な方法です。こうした改善は、頻繁には変更されないプロンプトの部分(指示の内容や参考資料の考慮事項)を保管することで実現され、モデルはそれらのトークンを繰り返し再処理する必要がなくなります。
たとえば、LLMにリクエスト(「人工知能とは何かをわかりやすく説明して」など)を送信すると、モデルはプロンプト全体を読んで理解し、応答します。同じプロンプトを再度送信すると、同じ処理が繰り返され、時間とコストが増加します。
プロンプト・キャッシュを使用すると、モデルは最初のリクエスト後にプロンプトの繰り返し部分を保存します。同じプロンプトを再送信すると、応答を再処理するのではなく、保管されている応答を取得します。このプロセスにより、同じプロンプトに対して同じ計算を繰り返す必要がなくなるため、応答がより速く効率的になり、コスト効率も向上します。[2]
目標と範囲:
アウトプットの信頼性:
パフォーマンス:
有効期限と無効化:
プロンプト・キャッシュでは、プロンプトの繰り返し部分が保存され、将来のリクエストで再利用できるため、再送信や再処理の必要がなくなります。
以下では、その仕組みにについて段階的に説明します。
LangChainは、LLMアプリケーションにプロンプト・キャッシュを追加するための柔軟なフレームワークを提供します。スタンドアロンのキャッシュ・システムとは対照的に、LangChainはLLMアプリケーションを構築するための統合フレームワークです。キャッシュが、チェーン、メモリー、検索拡張生成(RAG)、ツール統合などの他の必要なコンポーネントとともに1つのソリューションに統合されます。
LangChainを使用してプロンプト・キャッシュを実装する方法の詳細については、以下のリンクをクリックしてください。
主要なプラットフォームでは、キャッシュの書き込みと保持期間の管理を通じてプロンプト・キャッシュを運用し、TTLとキャッシュ制御を使用してアウトプットと使用レートを管理しています。これにより、データ・プライバシーを確保しつつ、キャッシュに応じて料金体系やコストを最適化できます。埋め込みスキーマとシステム指示をキャッシュしてリアルタイムのやり取りに活用することで、複数のマルチターン対話でツールの使いやすさを向上できます。
プロンプト・キャッシュにはメリットがありますが、最適化と性能に関連するため、制限に注意し続けることが重要です。主な考慮点は以下の通りです。
プロンプト・キャッシュは、チャットボット、コーディング・アシスタント、RAGパイプラインなどのAI駆動型システムの性能を向上させ、性能と効率の両方を向上させるインテリジェントなキャッシュ戦略です。完全なプロンプトまたはシステム・プロンプトに対する同じリクエストでAPIに複数のリクエストを行う代わりに、システムはキャッシュされたコンテンツ(プロンプト・プレフィックス、キャッシュ・プレフィックス、静的コンテンツなど)を活用して、インプット・トークンとアウトプット・トークンの両方でデータを節約します。
その結果、API呼び出しの回数が減り、キャッシュ・ミスが減り、レスポンス・レイテンシーとユーザー・エクスペリエンスが全体的に大幅に向上します。
プロンプト・キャッシュは、チャットボットのようなAI搭載システムに組み込まれているため、ユーザー・メッセージを活用することでパフォーマンスを向上させ、APIリクエストを減らし、簡潔なキャッシュ読み取りによってキャッシュ・ヒット率を大幅に向上させます。
アプリケーションで関数を実行したり、後続のリクエストやクエリーに応答したりする場合、プロンプト・キャッシュ機能により、プロンプト・トークン、総トークン、トークン数が保存され、メトリクスの追跡が容易になります。プロンプト・キャッシュを使用することで、チームはプロンプト・トークンと総トークンをリアルタイムで追跡し、生成AIのユースケースに合わせて世界規模で、かつ適切なタイミングのコスト、速度、信頼性で大規模言語モデルを拡張し続けることができます。
[1] Kaplan, J.、McCandlish, S.、Henighan, T.、Brown, T. B.、Chess, B.、Child, R.、Gray, S.、Radford, A.、Wu, J.、Amodei, D.(2020年)。「Scaling Laws for Neural Language Models」、arXiv
[2] Gim, I.、Chen, G.、Lee, S.、Sarda, N.、Khandelwal, A.、Zhong, L.(2024年)。「Prompt Cache: Modular Attention Reuse for Low-Latency Inference」、第7回機械学習とシステム年次会議の議事録(MLSys 2024年)。カリフォルニア州サンタクララ。
[3] OpenAI。「Prompt Caching」。OpenAIプラットフォーム・ドキュメンテーション、OpenAI、https://platform.openai.com/docs/guides/prompt-cachingでアクセス可能
[4] Gu, C.、Li, X. L.、Kuditipudi, R.、Liang, P.、Honey, T著(2025年)。「言語モデルAPIの監査プロンプト・キャッシュ」arXiv。https://arxiv.org/abs/2502.07776
[5] Kelly, Conor。「Prompt Caching: Reducing latency and cost over long prompts」。Humanloopブログ、2024年10月2日、https://humanloop.com/blog/prompt-caching
[6] Chakraborty, S.、Zhang, X.、Bansal, C.、Gupta, I.、Nath, S(2025年)。「Generative Caching for Structurally Similar Prompts and Responses」。
[7] Wu, G.、Zhang, Z.、Zhang, Y.、Wang, W.、Niu, J.、Wu, Y.、Zhang, Y.(2025年)。「I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving」。ネットワークおよび分散型システム・セキュリティ・シンポジグラム(NDSS)の議事録