프롬프트 캐싱이란 무엇인가요?

작성자

Shalini Harkar

Lead AI Advocate

대규모 언어 모델(LLM)은 매우 강력하지만 비용과 지연 시간이라는 중대한 두 문제가 있습니다. 처리되는 모든 토큰에는 요금이 부과되며, 사용자가 대용량 문서와 같은 동일한 컨텍스트를 반복적으로 쿼리하면 중복 계산을 트리거하여 비용이 증가합니다.

또한 이러한 요청을 처리하는 데 따른 지연 시간으로 인해 애플리케이션의 응답성이 저하되어 사용자 경험의 질이 떨어질 수 있습니다[1]. 프롬프트 캐싱은 이러한 문제를 해결하기 위한 핵심 솔루션으로 떠오르고 있습니다.

이 글에서는 프롬프트 캐싱이 정확히 무엇인지, 기존 캐싱과 어떻게 다른지, AI 애플리케이션에 어떻게 적용할 수 있는지, 어떤 사용 사례가 있는지 살펴봅니다. 나아가 프롬프트 캐싱과 관련한 이점과 주의 사항도 살펴보겠습니다. 

프롬프트 캐싱이란?

프롬프트 캐싱은 LLM의 속도와 비용 효율성을 향상시키는 간단한 방법입니다. 지침 내용이나 참고 자료 고려 사항과 같이 프롬프트에서 자주 변경되지 않는 부분을 저장하여 모델이 해당 토큰을 반복적으로 다시 처리할 필요가 없게 하는 것입니다. 

예를 들어 LLM에 요청을 보내면(예: "인공 지능이 무엇인지 설명해줘") 모델이 프롬프트 전체를 읽고 이해하고 응답합니다. 동일한 프롬프트를 다시 보내면 동일한 처리가 반복되어 시간과 비용이 증가합니다.

이때 프롬프트 캐싱을 사용하면 모델이 첫 번째 요청 후 프롬프트에서 반복되는 부분을 저장해 두었다가, 동일한 프롬프트가 또 입력되면 응답을 새로 처리하지 않고 저장했던 응답을 가져옵니다. 이 프로세스를 사용하면 모델이 동일한 프롬프트에 대해 동일한 계산을 다시 실행할 필요가 없기 때문에 더 빠르게 효율적으로, 비용을 효과적으로 사용해서 응답할 수 있습니다.[2]

프롬프트 캐싱은 기존 캐싱과 어떻게 다른가요?

목표 및 범위:

  • 프롬프트 캐싱은 반복되는 LLM 프롬프트를 저장하여 재계산을 방지하고 지연 시간을 줄입니다.
  • 기존 캐싱은 자주 액세스하는 데이터나 리소스(예: HTML 페이지, 데이터베이스 쿼리, API 응답, 이미지)를 저장하여 앞으로의 액세스 속도를 높입니다.

아웃풋 신뢰성:

  • 프롬프트 캐싱은 모든 요청에 대해 프롬프트와 모든 매개변수(온도, top-p 등)가 정확히 동일하게 유지되는 경우에만 작동합니다.
  • 기존 캐싱은 결정적입니다. 즉, 동일한 인풋에 대해 항상 동일한 아웃풋(동일한 쿼리 결과 또는 이미지 등)을 생성합니다.

성능:

  • 프롬프트 캐싱은 반복되거나 유사한 LLM 요청에 대한 토큰 사용량, API 비용 및 종단간 지연 시간을 줄여줍니다.
  • 기존 캐싱은 애플리케이션 성능을 개선하고 백엔드나 데이터베이스 부하, 네트워크 지연 시간을 줄입니다.

만료 및 무효화:

  • 프롬프트 캐싱은 모델 버전 업데이트 또는 재학습 주기와 연결되곤 합니다.
  • 기존 캐싱은 기본 데이터가 변경될 때 TTL(Time-to-Live), 버전 관리 또는 수동 무효화를 사용하여 관리합니다.[3]

프롬프트 캐싱은 어떻게 작동하나요?

프롬프트 캐싱에서는 프롬프트의 반복되는 섹션이 저장되므로 향후 요청에서 재사용할 수 있어서 재전송 및 재처리할 필요가 없습니다.

다음은 작동 방식에 대한 단계별 안내입니다. 

  1. 키 생성: 프롬프트가 제출되면 시스템에서 캐시 키를 생성합니다. 
    정확 일치 캐싱은 프롬프트 텍스트(또는 해시되거나 정규화된 형식)를 사용하며 모델 이름, 온도, 시스템 프롬프트와 같은 매개변수를 포함할 수 있습니다. 프롬프트와 모든 설정이 동일한 경우에만 작동합니다. 반면 시맨틱 캐싱은 프롬프트의 임베딩을 생성하고 의미상 유사한 항목을 검색합니다. 이 캐싱 유형은 문구가 변경되더라도 재사용할 수 있습니다. 이 두 가지 캐싱 방법은 각기 다른 장점을 가진 별개의 접근 방식입니다.
  2. 캐시 조회: 그런 다음 키 또는 임베딩을 일반적으로 기존 캐시인 경우 키값 저장소, 시맨틱 일치인 경우 벡터 데이터베이스와 대조하여 확인합니다.
  3. 캐시 복불복: 캐시 적중 시 저장된 결과가 즉시 반환되어 재처리가 방지됩니다. 캐시가 프롬프트를 모델에 잘못 전송하고 다음 번을 위해 출력을 저장합니다.
  4. 결과 저장: 캐시가 불발하더라도 LLM이 응답을 반환하면 생성된 아웃풋(및 경우에 따라 임베딩 또는 기타 메타데이터)이 해당 키 아래에 저장되어 나중에 사용할 수 있습니다.
  5. 무효화: 정확하고 시기적절한 답변을 유지하기 위해, 서버에서 정의한 TTL(Time-to-Live), 모델 업데이트 또는 콘텐츠 드리프트에 따라 캐시 항목이 만료될 수 있습니다.

LLM에서 프롬프트 캐싱 구현

LangChain은 LLM 애플리케이션에 프롬프트 캐싱을 추가하기 위한 유연한 프레임워크를 제공합니다. LangChain은 독립형 캐싱 시스템과는 반대로, LLM 애플리케이션 구축을 위한 통합 프레임워크입니다. 캐싱과 다른 필수 구성 요소를 체이닝, 메모리, 검색 증강 생성(RAG), 도구 통합과 같은 하나의 솔루션으로 통합합니다.

LangChain을 사용하는 프롬프트 캐싱 구현 방법을 알아보려면 클릭:

사용 사례

  • 대화형 문서 포털: 프롬프트 캐싱은 조직 정책, 절차 또는 기술 문서에 대해 자주 묻는 질문에 대한 응답을 저장하여 내부 지식 관리 시스템에서 매우 효과적입니다. 직원이 유사한 정보를 반복적으로 검색하면 캐시된 응답이 LLM을 반복적으로 쿼리하지 않고도 답변을 즉각 제공합니다. 

  • 마케팅 캠페인: 프롬프트 캐싱은 자주 묻는 질문에 대한 답변을 미리 계산하고 저장하여 챗봇과 자동화 시스템을 간소화합니다. 예를 들어 할인, 제품 사양 또는 재고 가용성에 대한 쿼리는 사용자가 자주 묻는 질문에 빠르게 답변을 받을 수 있도록 스트리밍됩니다. 캐시된 응답을 사용하면 트래픽이 많은 시간에 불필요한 API 비용을 줄이고 지연 시간을 완화하여 불필요한 LLM 호출을 방지하는 데 도움이 됩니다.

  • 고객 지원 시스템: 고객이 질문을 제출할 수 있는 지원 채널에서는 문제 해결, 계정 관리 또는 청구 관련 문의에 대한 일반적인 답변을 미리 저장해 둘 수 있습니다. 이를 통해 더 빠른 응답, 제공된 응답의 일관성, 동일한 유형의 문의에 대한 LLM 처리에 대한 의존도를 줄일 수 있습니다. 이러한 개선은 효율성 향상과 고객 만족도 향상으로 이어질 수 있습니다.[4]

장점

  • 비용 절감: LLM을 여러 번 호출하는 대신 프롬프트-응답 쌍을 재사용하여 API 비용을 절감합니다.
  • 속도: 캐시된 응답을 제공하면 즉각적인 답변을 제공해서 쿼리의 총 처리 시간이 절약되고 응답 시간이 늘어납니다.
  • 지능형 리소스 사용: 불필요하게 컴퓨팅을 낭비하지 말고, 리소스를 확보해서 다양하고 복잡한 기타 쿼리를 실행하세요.
  • 무한 용량: 높은 트래픽과 반복 쿼리를 합리적으로 관리하고, 애플리케이션이 확장되더라도 원활하게 작동하도록 유지합니다.
  • 일관된 응답: 모든 동일하거나 유사한 쿼리는 큐를 통해 매번 동일한 응답을 생성하여 사용자에게 신뢰할 수 있는 경험을 구축합니다.
  • 사용자 경험: 더 빠르고 예측 가능한 응답을 제공할 수 있으면 고객 대면 애플리케이션에서 사용자의 만족도를 높여서 더욱 유동적인 참여를 끌어낼 수 있습니다.
  • 서버 워크로드 감소: 캐시된 응답으로 답변할 수 있는 쿼리를 오프로드하여 서버 워크로드를 줄이고 시스템이 더 효율적으로 작동할 수 있도록 합니다.[5]

주요 플랫폼은 캐시 쓰기 및 보존 관리를 통해 프롬프트 캐싱 저장소를 사용하고, ttl 및 캐시 제어를 사용하여 아웃풋을 관리하고 비율을 준수하여 데이터 프라이버시를 보장하고 캐시와 관련된 사용 가격 또는 비용을 보장합니다. 임베딩 스키마 및 시스템 지침을 캐시하여 실시간 상호 작용에 사용할 수 있으므로 다중 회전 대화에서 도구 사용성을 개선할 수 있습니다. 

프롬프트 캐싱에서 고려할 사항

프롬프트 캐싱은 가치 있는 이점이 있을 수 있지만 최적화 및 성능과 관련된 제한 사항을 염두에 두는 것이 중요합니다. 다음 사항을 고려하세요. 

  • 동적 쿼리 또는 상황에 맞는 쿼리 관리: 프롬프트 캐싱은 동적(시간 또는 이전 사용자 입력)인 쿼리나 실시간 쿼리와 같이 상황에 맞는 쿼리에는 유틸리티가 제한된 경우가 많습니다. 데이터 업데이트나 반복되는 여러 차례의 대화가 있는 경우 이러한 쿼리는 새로운 정보에 반응하는 응답을 생성해야 합니다.
  • 구식 응답: 데이터나 컨텍스트가 변경되면 캐시된 응답이 금세 구식이 될 수 있으며, 이에 따라 부정확하거나 관련 없는 정보가 쿼리에 대한 응답으로 제공될 수 있습니다.
  • 예외적인 상황에 대한 복잡성: 프롬프트 부분 재사용을 지원하거나 특정 완화 조치를 위해 캐시를 수정하면 시스템 설계 및 구현이 더 복잡해져 더 많은 문제가 생길 수 있습니다.
  • 캐시 유지 관리의 어려움: 효과적인 캐시 관리(예: 만료 설정 또는 스토리지 제약)에는 운영 오버헤드가 발생할 수 있습니다.[6][7]

요약

프롬프트 캐싱은 챗봇, 코딩 어시스턴트 및 RAG 파이프라인과 같은 AI 기반 시스템의 성능을 향상시켜 성능과 효율성을 모두 개선하는 지능형 캐싱 전략입니다. 프롬프트 전체 또는 시스템 프롬프트에 대해 동일한 요청으로 API에 여러 요청을 하는 대신, 시스템이 캐시된 콘텐츠(예: 프롬프트 접두사, 캐시 접두사, 정적 콘텐츠)를 활용하여 인풋 토큰과 아웃풋 토큰 모두에 데이터가 저장되었음을 나타냅니다.

그 결과 API 호출 수가 감소하고 캐시 누락이 줄어들며 전반적으로 응답 지연 시간과 사용자 경험이 크게 향상됩니다. 

프롬프트 캐싱은 챗봇과 같은 내재된 AI 기반 시스템에서 가장 잘 작동하며, 사용자 메시지를 활용하여 성능을 향상시키고, API 요청을 줄이며, 간결한 캐시 읽기를 통해 캐시 적중률을 획기적으로 높입니다.

함수를 실행하거나 애플리케이션에서 후속 요청 또는 쿼리에 응답합니다. 프롬프트 캐싱은 프롬프트 토큰, 토큰 합계 및 토큰 수를 저장하고 지표 추적을 더 용이하게 합니다. 프롬프트 캐싱을 통해 팀은 프롬프트 토큰과 총 토큰을 실시간으로 추적하고 생성형 AI 사용 사례를 위해 시기적절한 비용, 속도 및 안정성을 갖추면서 대규모 언어 모델을 전반적으로 계속 확장할 수 있습니다.

참고 자료

[1] Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling Laws for Neural Language Models. arXiv

[2] Gim, I., Chen, G., Lee, S., Sarda, N., Khandelwal, A., & Zhong, L. (2024). Prompt Cache: Modular Attention Reuse for Low-Latency Inference. Proceedings of the 7th Annual Conference on Machine Learning and Systems (MLSys 2024). Santa Clara, CA.

[3] OpenAI. “Prompt Caching.” OpenAI Platform Documentation, OpenAI, 열람: https://platform.openai.com/docs/guides/prompt-caching

[4] Gu, C., Li, X. L., Kuditipudi, R., Liang, P., & Hashimoto, T. (2025). Auditing Prompt Caching in Language Model APIs. arXiv. https://arxiv.org/abs/2502.07776

[5] Kelly, Conor. Prompt Caching: Reducing latency and cost over long prompts. Humanloop Blog, 2024년 10월 2일, https://humanloop.com/blog/prompt-caching

[6] Chakraborty, S., Zhang, X., Bansal, C., Gupta, I., & Nath, S. (2025). Generative Caching for Structurally Similar Prompts and Responses.

[7] Wu, G., Zhang, Z., Zhang, Y., Wang, W., Niu, J., Wu, Y., & Zhang, Y. (2025). I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving. Proceedings of the Network and Distributed System Security Symposium (NDSS)

관련 솔루션
IBM® watsonx Orchestrate

IBM® watsonx Orchestrate를 사용하여 확장 가능한 AI 어시스턴트 및 에이전트를 쉽게 설계하고, 반복적인 작업을 자동화하며, 복잡한 프로세스를 간소화합니다.

watsonx Orchestrate 살펴보기
인공 지능 솔루션

업계 최고의 AI 전문성과 솔루션 포트폴리오를 보유한 IBM과 함께 AI를 비즈니스에 활용하세요.

AI 솔루션 살펴보기
인공 지능 컨설팅 및 서비스

IBM Consulting AI 서비스는 기업이 AI 활용 방식을 재구상하여 혁신을 달성하도록 지원합니다.

AI 서비스 살펴보기
다음 단계 안내

사전 구축된 앱과 스킬을 맞춤화하든, AI 스튜디오를 통해 맞춤형 에이전틱 서비스를 구축하고 배포하든 상관없이 IBM® watsonx 플랫폼이 전 과정을 지원합니다.

  1. watsonx Orchestrate 살펴보기
  2. AI 솔루션 살펴보기