¿Qué es prompt caching?

Autor

Shalini Harkar

Lead AI Advocate

Los modelos de lenguaje grandes (LLM) son increíblemente poderosos, pero conllevan con dos desafíos importantes: el costo y la latencia. Cada token procesado incurre en un cargo, y cuando los usuarios consultan repetidamente el mismo contexto, como un documento grande, aumentan los costos al desencadenar cálculos redundantes.

Además, la latencia asociada con el procesamiento de estas solicitudes puede degradar la capacidad de respuesta de su aplicación, lo que conlleva una experiencia de usuario deficiente[1]. El almacenamiento en caché de instrucciones surge como una solución clave para enfrentar estos desafíos.

En este artículo, exploraremos qué es exactamente el almacenamiento en caché de instrucciones, en qué se diferencia del almacenamiento en caché convencional y cómo se puede usar en aplicaciones de IA o varios casos de uso. También veremos los beneficios y las advertencias a considerar con el almacenamiento en caché de instrucciones. 

¿Qué es el almacenamiento en caché de instrucciones?

El almacenamiento en caché de instrucciones es un método sencillo para mejorar la velocidad y la rentabilidad de los LLM. Logra estas mejoras almacenando partes frecuentemente sin cambios de una instrucción, como contenido instructivo o consideraciones de material de referencia, para que el modelo no tenga que reprocesar esos tokens repetidamente. 

Por ejemplo, cuando usted envía una solicitud a un LLM (como “explica qué es la inteligencia artificial”), el modelo lee toda la instrucción para entender y responder. Si vuelve a enviar la misma instrucción, repite el mismo procesamiento, lo que aumenta el tiempo y el costo.

Con el almacenamiento en caché de instrucciones, el modelo guarda partes repetidas de una instrucción después de la primera solicitud. Cuando usted reenvía la misma instrucción, recupera la respuesta almacenada en lugar de reprocesarla. Este proceso hace que las respuestas sean más rápidas, más eficientes y rentables, ya que el modelo no tiene que rehacer el mismo cálculo para instrucciones idénticas.[2]

¿En qué se diferencia el almacenamiento en caché de instrucciones del almacenamiento en caché convencional?

Objetivo y alcance:

  • El almacenamiento en caché de instrucciones guarda las instrucciones de LLM repetidas para evitar el recálculo y reducir la latencia.
  • El almacenamiento en caché convencional guarda datos o recursos a los que se accede con frecuencia (por ejemplo, páginas HTML, consultas a bases de datos, respuestas de API, imágenes) para agilizar el acceso futuro.

Confiabilidad de los resultados:

  • El almacenamiento en caché de instrucciones solo funciona cuando la instrucción y todos los parámetros (como temperatura, top-p y otros) permanecen exactamente iguales para cada solicitud.
  • El almacenamiento en caché convencional es determinista, lo que significa que la misma entrada siempre produce la misma salida (como resultados de consulta o imágenes idénticos).

Rendimiento:

  • El almacenamiento en caché de instrucciones reduce el uso de tokens, el costo de la API y la latencia de extremo a extremo para solicitudes de LLM repetidas o similares.
  • El almacenamiento en caché convencional mejora el rendimiento de las aplicaciones, reduce la carga del backend o de la base de datos y disminuye la latencia de la red.

Caducidad e invalidación:

  • El almacenamiento en caché de instrucciones suele estar vinculado a actualizaciones de versiones del modelo o ciclos de reentrenamiento.
  • El almacenamiento en caché convencional se gestiona mediante el uso de TTL (tiempo de vida), control de versiones o invalidación manual cuando cambian los datos subyacentes.[3]

¿Cómo funciona el almacenamiento en caché de instrucciones?

En el almacenamiento en caché de instrucciones, las secciones repetidas de una instrucción se almacenan para que puedan reutilizarse en futuras solicitudes, evitando la necesidad de reenviarlas y reprocesarlas.

Aquí está la guía paso a paso de cómo funciona: 

  1. Generación de claves: cuando se envía una instrucción, el sistema crea una clave de caché. 
    El almacenamiento en caché de coincidencia exacta usa el texto de la instrucción (o una forma estandarizada o con hash) y puede incluir parámetros como el nombre del modelo, la temperatura o la instrucción del sistema. Solo funciona cuando la instrucción y todas las configuraciones son idénticas.
    El almacenamiento en caché semántico, alternativamente, genera una incorporación de la instrucción y busca entradas semánticamente similares. Este tipo de almacenamiento en caché permite la reutilización incluso si cambia la redacción. Estos dos métodos de almacenamiento en caché son enfoques separados con diferentes fortalezas.
  2. Búsqueda en caché: la clave o la incorporación se comprueba luego en el almacén de caché, que suele ser un almacén de clave-valor para una caché más tradicional, o una base de datos vectorial para coincidencias semánticas.
  3. Aciertos y errores de caché: un acierto de caché devuelve un resultado almacenado de inmediato, evitando el reprocesamiento. Una error de caché envía mal la instrucción al modelo, y luego almacena los resultados para la próxima vez.
  4. Almacenar el resultado: si bien hay un error de caché, una vez que el LLM devuelve una respuesta, el resultado generado (y, a veces, la incorporación u otros metadatos) se almacenará bajo esa clave para su uso en el futuro.
  5. Invalidación: las entradas de caché pueden caducar en función del tiempo de vida (TTL) definido por el servidor, la actualización del modelo o la desviación del contenido para mantener las respuestas precisas y oportunas.

Implementación del almacenamiento en caché de instrucciones en LLM

LangChain proporciona una infraestructura flexible para agregar caché de instrucciones en aplicaciones LLM. A diferencia de los sistemas de almacenamiento en caché independientes, LangChain es un marco integrado para crear aplicaciones LLM. Reúne el almacenamiento en caché con otros componentes necesarios en una sola solución, como el encadenamiento, la memoria, la generación aumentada por recuperación (RAG, por sus siglas en inglés) y la integración de herramientas.

Para aprender más sobre cómo implementar el almacenamiento en caché de instrucciones mediante LangChain, haga clic en el siguiente enlace:

Casos de uso

  • Portales de documentación interactivos: el almacenamiento en caché de instrucciones es muy eficaz en los sistemas internos de gestión del conocimiento al almacenar las respuestas a las consultas frecuentes sobre políticas, procedimientos o documentación técnica de la organización. Cuando los empleados buscan repetidamente información similar, las respuestas almacenadas en caché proporcionan respuestas instantáneas sin consultar repetidamente el LLM. 

  • Campañas de marketing: el almacenamiento en caché de instrucciones optimiza los sistemas de chatbot y automatización al precalcular y guardar las respuestas a las preguntas más frecuentes. Por ejemplo, las consultas sobre descuentos, especificaciones de productos o disponibilidad de existencias se transmiten para garantizar que los usuarios reciban respuestas rápidas a las preguntas más frecuentes. En momentos de alto tráfico de usuarios, las respuestas en caché ayudan a evitar llamadas al LLM innecesarias, al reducir los costos innecesarios de API y reducir la latencia.

  • Sistemas de atención al cliente: en los canales de soporte que permiten a los clientes enviar preguntas, las respuestas a las consultas comunes para solucionar problemas, problemas de gestión de cuentas o de facturación pueden ser instrucciones en caché. Esto conduciría a respuestas más rápidas, coherencia con las respuestas proporcionadas y una menor dependencia del procesamiento del LLM para los mismos tipos de consultas. Estas mejoras pueden derivar en mejoras en eficiencia y a una mayor satisfacción del cliente.[4]

Ventajas

  • Reducción de costos: ahorre en costos de API reutilizando pares de instrucción-respuesta en lugar de llamar al LLM varias veces.
  • Velocidad: entregar una respuesta en caché proporciona una respuesta inmediata. Ahorra el tiempo total de procesamiento de la consulta y aumenta el tiempo de respuesta.
  • Uso inteligente de recursos: no desperdicie recursos informáticos innecesariamente y reserve recursos para ejecutar otras consultas complejas y variadas.
  • Capacidad infinita: gestione de forma razonable el tráfico elevado y las consultas repetidas, y mantenga la aplicación en marcha sin problemas a medida que escala.
  • Respuestas coherentes: todas las consultas idénticas o similares producen la misma respuesta, una y otra vez, a través de una señal, creando experiencias confiables para el usuario.
  • Experiencia del usuario: ser capaz de proporcionar respuestas más rápidas y predecibles produce interacciones más fluidas para usuarios más satisfechos en una aplicación orientada al cliente.
  • Reducción de la carga de trabajo del servidor: reduzca la carga de trabajo del servidor y permita que su sistema funcione con mayor eficiencia al descargar las consultas que pueden responderse con una respuesta almacenada en caché.[5]

Las plataformas prominentes utilizan almacenamiento en caché de instrucciones a través de escrituras de caché y gestión de retención, mientras que utilizan ttl y control de caché para gestionar sus resultados y respetar las tasas, garantizando la privacidad de datos y los precios de uso en relación con la caché. Los esquemas de incorporación y las instrucciones del sistema se pueden almacenar en caché para su uso con interacciones en tiempo real para mejorar la usabilidad de las herramientas en múltiples conversaciones de varios turnos. 

Puntos a considerar en el almacenamiento en caché de instrucciones

Aunque el almacenamiento en caché de instrucciones puede tener beneficios que valen la pena, es importante tener en cuenta las limitaciones en lo que respecta a la optimización y el rendimiento. Algunas consideraciones clave incluyen: 

  • Gestión de consultas dinámicas o que dependen del contexto: si bien el almacenamiento en caché de instrucciones a menudo tiene una utilidad limitada para consultas dinámicas (en el tiempo o a partir de la entrada previa del usuario) o consultas que dependen del contexto, como consultas que podrían incorporar actualizaciones de datos en tiempo real o una conversación repetida de varios turnos, esas consultas deben producir una respuesta que responda a la nueva información.
  • Respuestas obsoletas: las respuestas almacenadas en caché pueden quedar obsoletas con bastante rapidez si los datos o el contexto han cambiado, lo que proporcionaría información incorrecta o irrelevante en respuesta a una consulta.
  • Complejidad para casos edge: modificar la caché para admitir la reutilización parcial de instrucciones, o para mitigaciones específicas, puede causar más problemas, ya que las modificaciones aumentan la complejidad del diseño y el esfuerzo de implementación del sistema.
  • Desafíos en el mantenimiento de la caché: la gestión eficaz de la caché (por ejemplo, la configuración de caducidad o las restricciones de almacenamiento) puede conllevar una sobrecarga operativa.[6][7]

Resumen

El almacenamiento en caché de instrucciones es una estrategia de almacenamiento en caché inteligente que mejora el rendimiento de los sistemas impulsados por IA, como chatbots, asistentes de programación y pipelines de RAG para mejorar tanto el rendimiento como la eficiencia. En lugar de realizar múltiples solicitudes a la API con la misma solicitud para la instrucción completa o la instrucción del sistema, el sistema usa el contenido almacenado en caché (por ejemplo, prefijos de instrucción, prefijos de caché, contenido estático) para representar ese ahorro de datos tanto en tokens de entrada como tokens de resultados.

El resultado es una reducción en el número de llamadas a la API, menos errores de caché y un aumento general significativo en la latencia de respuesta y la experiencia del usuario. 

El almacenamiento en caché de instrucciones funciona mejor para los sistemas intrínsecos a los impulsados por IA, como los chatbots, mejora el rendimiento al aprovechar los mensajes de los usuarios, y puede reducir las solicitudes de API y aumentar drásticamente las tasas de aciertos de caché a través de una lectura de caché concisa.

Para ejecutar una función o responder a solicitudes o consultas posteriores en su aplicación; el almacenamiento en caché de instrucciones ahorra tokens de instrucciones, tokens totales y recuentos de tokens, además de mejorar la facilidad de seguimiento de las métricas. Con el almacenamiento en caché de instrucciones, los equipos pueden realizar un seguimiento de los tokens de instrucción y del total de tokens en tiempo real, y continuar escalando modelos de lenguaje grandes a un costo, velocidad y confiabilidad óptimos a escala global para casos de uso de IA generativa.

Referencias

[1] Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling Laws for Neural Language Models. arXiv

[2] Gim, I., Chen, G., Lee, S., Sarda, N., Khandelwal, A., & Zhong, L. (2024). Prompt Cache: Modular Attention Reuse for Low-Latency Inference. Proceedings of the 7th Annual Conference on Machine Learning and Systems (MLSys 2024). Santa Clara, California.

[3] OpenAI. “Prompt Caching.” Documentación de la plataforma OpenAI, OpenAI, accesible en https://platform.openai.com/docs/guides/prompt-caching

[4] Gu, C., Li, X. L., Kuditipudi, R., Liang, P., & Hashimoto, T. (2025). Auditing Prompt Caching in Language Model APIs. arXiv. https://arxiv.org/abs/2502.07776

[5] Kelly, Conor. Prompt Caching: Reducing latency and cost over long prompts. Blog de Humanloop, 2 de octubre de 2024, https://humanloop.com/blog/prompt-caching

[6] Chakraborty, S., Zhang, X., Bansal, C., Gupta, I., & Nath, S. (2025). Generative Caching for Structurally Similar Prompts and Responses.

[7] Wu, G., Zhang, Z., Zhang, Y., Wang, W., Niu, J., Wu, Y., & Zhang, Y. (2025). I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving. Proceedings of the Network and Distributed System Security Symposium (NDSS)

Soluciones relacionadas
IBM watsonx Orchestrate

Diseñe asistentes y agentes de IA escalables con facilidad, automatice tareas repetitivas y simplifique procesos complejos con IBM watsonx Orchestrate.

Explore watsonx Orchestrate
Soluciones de inteligencia artificial

Ponga a trabajar la IA en su negocio con el apoyo de la experiencia en IA líder del sector y la cartera de soluciones de IBM.

Explore las soluciones de IA
Consultoría y servicios de inteligencia artificial

Los servicios de IA de IBM Consulting ayudan a reinventar la forma en que las empresas trabajan con IA para la transformación.

Explore los servicios de IA
Dé el siguiente paso

Ya sea que elija personalizar aplicaciones y habilidades predefinidas o crear y desplegar servicios agénticos personalizados con un estudio de IA, la plataforma IBM® watsonx tiene todo lo que necesita.

  1. Explore watsonx Orchestrate
  2. Explore las soluciones de IA