
Definición en una frase
Reutilización de prefijos de entrada ya procesados para reducir latencia o coste cuando el proveedor y la petición lo permiten.
Definición: reutilizar cálculos, no adquirir recuerdos
La caché de contexto en inteligencia artificial es un almacenamiento temporal de resultados de procesamiento que un modelo puede reutilizar para no volver a calcular ciertas partes de una entrada. En los modelos de lenguaje, el término suele referirse a dos mecanismos relacionados, pero distintos: la caché KV, que conserva estados internos de atención durante la generación, y la caché de prefijos o prompts, que permite aprovechar el procesamiento de un comienzo idéntico o coincidente entre solicitudes.
El término «contexto» puede inducir a error. Aquí no significa que el sistema haya incorporado información a su conocimiento permanente ni que recuerde necesariamente una conversación después de terminarla. Describe los datos que el modelo procesa para responder, junto con los resultados intermedios que una implementación puede mantener disponibles durante cierto tiempo. La caché reduce trabajo repetido cuando se dan las condiciones adecuadas; no añade por sí misma información nueva a la respuesta.
El mecanismo concreto depende del modelo, el runtime y el servicio. Una implementación puede exponer métricas de uso de caché, ofrecer controles para compartir o aislar ciertos datos, o no hacer visible el mecanismo al usuario. Por eso, «caché de contexto» es una etiqueta útil, pero conviene precisar qué tipo de caché se está describiendo.
Cómo funciona la caché KV durante la generación
En un modelo autorregresivo, el texto se genera token a token: cada paso predice el siguiente token a partir de los anteriores. Para calcular la atención, el modelo produce representaciones internas conocidas como claves (keys) y valores (values). La caché KV conserva esos tensores para los tokens ya procesados, de modo que los pasos siguientes puedan reutilizarlos en vez de recalcularlos todos desde el principio.
En términos simplificados, el modelo procesa el prompt, calcula los estados necesarios y guarda las claves y los valores correspondientes. Después, al generar un token nuevo, calcula los estados del nuevo paso y consulta también los estados almacenados de los tokens anteriores. La caché crece mientras continúa la generación, dentro de los límites de memoria y de la estrategia de gestión que utilice el sistema.
Esta descripción se refiere al funcionamiento general, no a una estructura idéntica en todos los modelos. Hay variantes de caché y distintas estrategias para administrarla, mantenerla o situarla en diferentes niveles de memoria. En un servicio, también pueden existir mecanismos para reutilizar bloques entre solicitudes; eso no debe confundirse automáticamente con la caché KV de una única secuencia.
Ciclo simplificado de una caché KV
- 01El modelo procesa el prompt y calcula estados internos de atención.
- 02La implementación conserva las claves y los valores de los tokens procesados.
- 03Para producir el siguiente token, el modelo reutiliza esos estados y calcula el nuevo paso.
- 04El proceso se repite mientras haya generación y recursos disponibles.
Caché de prefijos: reutilización entre solicitudes
La caché de prefijos o prompts aprovecha partes iniciales repetidas de distintas solicitudes. En lugar de recalcular el procesamiento de un prefijo que ya está disponible en caché, el sistema puede reutilizar los bloques de estados KV asociados a ese prefijo y continuar el cálculo a partir de ahí. Un servidor puede aplicar esta técnica, por ejemplo, cuando muchas solicitudes comparten instrucciones iniciales o un fragmento común de contexto.
La reutilización exige una coincidencia suficiente según las reglas de la implementación. En sistemas que organizan la caché por bloques, el prefijo se divide en bloques y se comprueba si los bloques previos coinciden; no basta con que dos solicitudes traten el mismo tema. Cambios en el texto, el orden o la tokenización pueden impedir una coincidencia. También pueden influir otros componentes de la configuración, según el sistema.
La caché de prefijos no implica que se guarde una respuesta para devolverla sin más. Lo que se reutiliza es el procesamiento de una parte compartida de la entrada; la solicitud nueva todavía puede tener contenido diferente y requerir cálculos adicionales. La coincidencia, la disponibilidad de los bloques y las reglas de expiración o expulsión determinan si el beneficio se produce.
Algunos proveedores describen esta función con métricas específicas, como la cantidad de tokens de entrada que se procesan desde la caché. Esas métricas y las condiciones de retención corresponden a la implementación documentada: no deben extrapolarse a otros proveedores o runtimes.
Qué se reutiliza y en qué situación
| Mecanismo | Qué conserva o reutiliza | Uso típico | Límite principal |
|---|---|---|---|
| Caché KV de una generación | Claves y valores de atención de tokens ya procesados | Continuar una generación token a token | La secuencia y los recursos disponibles condicionan su tamaño y uso |
| Caché de prefijos o prompts | Estados KV de un prefijo coincidente entre solicitudes | Evitar recalcular una parte repetida de las entradas | Solo sirve si se cumplen las reglas de coincidencia y los bloques siguen disponibles |
| Memoria persistente de una aplicación | Datos que el sistema decide guardar para futuras interacciones | Recuperar preferencias o información en otra sesión | Es una función distinta, con reglas de almacenamiento propias |
Tres ejemplos aplicados
Los ejemplos siguientes describen posibles usos del mecanismo, no prometen que una plataforma concreta implemente la caché de la misma forma ni que siempre obtenga una mejora medible.
blocks
examples
Conceptos que se confunden con frecuencia
Caché y ventana de contexto no son sinónimos. La ventana de contexto es la cantidad de información que el modelo puede considerar en una ejecución, con límites definidos por el modelo o el servicio. La caché es un mecanismo para conservar o reutilizar cálculos. Una caché no amplía por sí sola la ventana ni permite incluir más texto del que admite el sistema.
Caché y memoria persistente tampoco son lo mismo. Una memoria de agente o de aplicación puede guardar información para recuperarla en interacciones posteriores, según sus reglas de diseño. Una caché de procesamiento sirve para reutilizar resultados intermedios y puede desaparecer, caducar o ser expulsada. Aunque ambas funciones puedan almacenar datos temporalmente, cumplen propósitos distintos.
La caché KV y la caché de prefijos tampoco describen exactamente la misma operación. La primera suele aludir a los estados que se mantienen durante la generación de una secuencia; la segunda, a la oportunidad de aprovechar estados de un prefijo compartido entre solicitudes. Un sistema de caché de prefijos puede basarse en bloques KV, pero el alcance entre solicitudes añade condiciones de coincidencia, gestión y aislamiento.
Por último, reutilizar procesamiento no es lo mismo que reutilizar el contenido textual como una respuesta preparada. Si dos solicitudes comparten un prefijo, la parte común puede aprovechar estados internos ya calculados. Eso no implica que el texto de salida esté guardado, que la respuesta nueva sea idéntica a una anterior o que el modelo haya adquirido comprensión adicional.
Límites, privacidad y operación
La caché no es ilimitada. Los estados KV ocupan memoria, y los sistemas de servicio deben administrar los bloques que mantienen disponibles. Cuando faltan recursos, una implementación puede expulsar bloques o aplicar otras estrategias de gestión; una entrada que antes podía reutilizarse quizá ya no esté disponible cuando llegue otra solicitud. La duración efectiva y las reglas de caducidad no son universales.
También importa la coincidencia. Un prefijo parecido en significado puede no ser coincidente para la caché si su secuencia de tokens difiere. Cambios de modelo, de plantilla o de configuración pueden modificar el procesamiento o la forma en que se detectan los prefijos. Por eso, no debe darse por hecho que repetir una instrucción garantiza reutilización.
La privacidad exige revisar la documentación y la configuración del sistema concreto. Conviene comprobar cuánto tiempo se mantienen los datos en caché, cómo se aíslan solicitudes o usuarios, si hay controles de partición o de invalidación y qué métricas se exponen. La caché compartida entre solicitudes puede introducir consideraciones de aislamiento; la documentación de algunos sistemas advierte, por ejemplo, de riesgos de canal lateral y describe medidas específicas para mitigarlos. Esa advertencia no demuestra que todos los servicios tengan el mismo riesgo ni que una medida particular esté disponible en todos ellos.
Las métricas también requieren contexto. Un contador de tokens atendidos desde caché puede describir reutilización de entrada, pero no permite concluir por sí solo cuánto se ahorró en coste o latencia. Esos resultados dependen de la API, el hardware, la carga, la configuración y la forma de facturar o medir. Las afirmaciones cuantitativas deben atribuirse al proveedor y a las condiciones donde fueron medidas.
Lista de comprobación para evaluar una caché
- 01Identifica si se trata de caché KV por generación, caché de prefijos entre solicitudes o ambas.
- 02Comprueba qué elementos deben coincidir para que se reutilicen estados y qué cambios invalidan la coincidencia.
- 03Revisa límites de memoria, caducidad, expulsión y controles de aislamiento documentados.
- 04Distingue las métricas de tokens en caché de las mediciones de latencia, coste o rendimiento.
- 05Consulta por separado las políticas de retención de caché y las políticas de memoria conversacional o almacenamiento de la aplicación.
Conceptos relacionados y criterios prácticos
La atención es el mecanismo del modelo que relaciona partes de la secuencia; las claves y los valores son componentes internos utilizados en ese cálculo. Los tokens son las unidades de entrada y salida con las que trabaja el modelo. La inferencia es el proceso de usar el modelo para producir una salida. La caché KV ayuda a evitar repetir parte del trabajo de atención, mientras que una caché de prefijos busca reutilizar el procesamiento de una entrada compartida. Estos conceptos se conectan, pero no son intercambiables.
Al leer documentación o configurar un sistema, pregunta primero qué se almacena: estados KV, un prefijo procesado, texto conversacional u otro dato. Después, averigua en qué ámbito vive la caché —una generación, una sesión o varias solicitudes—, cuánto dura, qué hace que una coincidencia sea válida y cómo se gestiona la falta de memoria. Por último, separa los datos medidos por la plataforma de las expectativas: reutilizar cálculos puede reducir trabajo repetido, pero el ahorro concreto y la latencia dependen de las circunstancias.
Como orientación general, si el interés es continuar una generación token a token, busca información sobre caché KV y sus estrategias. Si varias solicitudes comparten un comienzo extenso, busca documentación sobre caché de prefijos y sus reglas de coincidencia. Si necesitas que el sistema recupere datos de usuario entre sesiones, consulta la función de memoria persistente o almacenamiento de la aplicación, no presupongas que una caché de contexto lo hará.
Criterio rápido de decisión
| Necesidad | Concepto que conviene consultar | Pregunta práctica |
|---|---|---|
| Evitar recalcular estados en una generación en curso | Caché KV | ¿Qué estrategia y límites de memoria usa el runtime? |
| Reutilizar un prefijo común entre llamadas | Caché de prefijos o prompts | ¿Qué debe coincidir y durante cuánto tiempo quedan disponibles los bloques? |
| Recuperar preferencias o datos en futuras sesiones | Memoria persistente o almacenamiento de la aplicación | ¿Qué se guarda, quién puede acceder y cómo se elimina? |