대규모 언어 모델(LLM)은 매우 강력하지만 비용과 지연 시간이라는 중대한 두 문제가 있습니다. 처리되는 모든 토큰에는 요금이 부과되며, 사용자가 대용량 문서와 같은 동일한 컨텍스트를 반복적으로 쿼리하면 중복 계산을 트리거하여 비용이 증가합니다.
또한 이러한 요청을 처리하는 데 따른 지연 시간으로 인해 애플리케이션의 응답성이 저하되어 사용자 경험의 질이 떨어질 수 있습니다[1]. 프롬프트 캐싱은 이러한 문제를 해결하기 위한 핵심 솔루션으로 떠오르고 있습니다.
이 글에서는 프롬프트 캐싱이 정확히 무엇인지, 기존 캐싱과 어떻게 다른지, AI 애플리케이션에 어떻게 적용할 수 있는지, 어떤 사용 사례가 있는지 살펴봅니다. 나아가 프롬프트 캐싱과 관련한 이점과 주의 사항도 살펴보겠습니다.
프롬프트 캐싱은 LLM의 속도와 비용 효율성을 향상시키는 간단한 방법입니다. 지침 내용이나 참고 자료 고려 사항과 같이 프롬프트에서 자주 변경되지 않는 부분을 저장하여 모델이 해당 토큰을 반복적으로 다시 처리할 필요가 없게 하는 것입니다.
예를 들어 LLM에 요청을 보내면(예: "인공 지능이 무엇인지 설명해줘") 모델이 프롬프트 전체를 읽고 이해하고 응답합니다. 동일한 프롬프트를 다시 보내면 동일한 처리가 반복되어 시간과 비용이 증가합니다.
이때 프롬프트 캐싱을 사용하면 모델이 첫 번째 요청 후 프롬프트에서 반복되는 부분을 저장해 두었다가, 동일한 프롬프트가 또 입력되면 응답을 새로 처리하지 않고 저장했던 응답을 가져옵니다. 이 프로세스를 사용하면 모델이 동일한 프롬프트에 대해 동일한 계산을 다시 실행할 필요가 없기 때문에 더 빠르게 효율적으로, 비용을 효과적으로 사용해서 응답할 수 있습니다.[2]
목표 및 범위:
아웃풋 신뢰성:
성능:
만료 및 무효화:
프롬프트 캐싱에서는 프롬프트의 반복되는 섹션이 저장되므로 향후 요청에서 재사용할 수 있어서 재전송 및 재처리할 필요가 없습니다.
다음은 작동 방식에 대한 단계별 안내입니다.
LangChain은 LLM 애플리케이션에 프롬프트 캐싱을 추가하기 위한 유연한 프레임워크를 제공합니다. LangChain은 독립형 캐싱 시스템과는 반대로, LLM 애플리케이션 구축을 위한 통합 프레임워크입니다. 캐싱과 다른 필수 구성 요소를 체이닝, 메모리, 검색 증강 생성(RAG), 도구 통합과 같은 하나의 솔루션으로 통합합니다.
LangChain을 사용하는 프롬프트 캐싱 구현 방법을 알아보려면 클릭:
주요 플랫폼은 캐시 쓰기 및 보존 관리를 통해 프롬프트 캐싱 저장소를 사용하고, ttl 및 캐시 제어를 사용하여 아웃풋을 관리하고 비율을 준수하여 데이터 프라이버시를 보장하고 캐시와 관련된 사용 가격 또는 비용을 보장합니다. 임베딩 스키마 및 시스템 지침을 캐시하여 실시간 상호 작용에 사용할 수 있으므로 다중 회전 대화에서 도구 사용성을 개선할 수 있습니다.
프롬프트 캐싱은 가치 있는 이점이 있을 수 있지만 최적화 및 성능과 관련된 제한 사항을 염두에 두는 것이 중요합니다. 다음 사항을 고려하세요.
프롬프트 캐싱은 챗봇, 코딩 어시스턴트 및 RAG 파이프라인과 같은 AI 기반 시스템의 성능을 향상시켜 성능과 효율성을 모두 개선하는 지능형 캐싱 전략입니다. 프롬프트 전체 또는 시스템 프롬프트에 대해 동일한 요청으로 API에 여러 요청을 하는 대신, 시스템이 캐시된 콘텐츠(예: 프롬프트 접두사, 캐시 접두사, 정적 콘텐츠)를 활용하여 인풋 토큰과 아웃풋 토큰 모두에 데이터가 저장되었음을 나타냅니다.
그 결과 API 호출 수가 감소하고 캐시 누락이 줄어들며 전반적으로 응답 지연 시간과 사용자 경험이 크게 향상됩니다.
프롬프트 캐싱은 챗봇과 같은 내재된 AI 기반 시스템에서 가장 잘 작동하며, 사용자 메시지를 활용하여 성능을 향상시키고, API 요청을 줄이며, 간결한 캐시 읽기를 통해 캐시 적중률을 획기적으로 높입니다.
함수를 실행하거나 애플리케이션에서 후속 요청 또는 쿼리에 응답합니다. 프롬프트 캐싱은 프롬프트 토큰, 토큰 합계 및 토큰 수를 저장하고 지표 추적을 더 용이하게 합니다. 프롬프트 캐싱을 통해 팀은 프롬프트 토큰과 총 토큰을 실시간으로 추적하고 생성형 AI 사용 사례를 위해 시기적절한 비용, 속도 및 안정성을 갖추면서 대규모 언어 모델을 전반적으로 계속 확장할 수 있습니다.
[1] Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling Laws for Neural Language Models. arXiv
[2] Gim, I., Chen, G., Lee, S., Sarda, N., Khandelwal, A., & Zhong, L. (2024). Prompt Cache: Modular Attention Reuse for Low-Latency Inference. Proceedings of the 7th Annual Conference on Machine Learning and Systems (MLSys 2024). Santa Clara, CA.
[3] OpenAI. “Prompt Caching.” OpenAI Platform Documentation, OpenAI, 열람: https://platform.openai.com/docs/guides/prompt-caching
[4] Gu, C., Li, X. L., Kuditipudi, R., Liang, P., & Hashimoto, T. (2025). Auditing Prompt Caching in Language Model APIs. arXiv. https://arxiv.org/abs/2502.07776
[5] Kelly, Conor. Prompt Caching: Reducing latency and cost over long prompts. Humanloop Blog, 2024년 10월 2일, https://humanloop.com/blog/prompt-caching
[6] Chakraborty, S., Zhang, X., Bansal, C., Gupta, I., & Nath, S. (2025). Generative Caching for Structurally Similar Prompts and Responses.
[7] Wu, G., Zhang, Z., Zhang, Y., Wang, W., Niu, J., Wu, Y., & Zhang, Y. (2025). I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving. Proceedings of the Network and Distributed System Security Symposium (NDSS)