For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Almacenamiento de prompts en caché

Reduce la latencia y el costo con el almacenamiento de prompts en caché.

Por qué es importante el almacenamiento de prompts en caché

El almacenamiento de prompts en caché reutiliza el trabajo realizado cuando las solicitudes comparten el mismo prefijo de prompt. Esto ofrece tres beneficios principales:

  • Uso eficiente del cómputo: evita volver a calcular un prefijo de prompt que el modelo ya procesó.
  • Tokens de entrada más económicos: paga la tarifa reducida del modelo para entradas en caché por los tokens reutilizados, con descuentos de hasta el 90 %.
  • Mayor rapidez: reduce el tiempo dedicado a procesar la entrada antes de que comience la respuesta.

El almacenamiento de prompts en caché está habilitado de forma predeterminada en los modelos de OpenAI compatibles. Usa el panel de almacenamiento de prompts en caché para monitorear las tasas de aciertos de lectura de caché y la herramienta de diagnóstico de la caché de prompts para diagnosticar fallos de caché y mejorar su reutilización.

Las llamadas a modelos de la API de agentes usan el mismo comportamiento de almacenamiento de prompts en caché que la API Responses. Reutilizar el contexto dentro de una sesión puede preservar un prefijo de prompt compartido, pero mantener una sesión no garantiza un acierto de caché. Consulta Observabilidad y uso para conocer los campos de uso de la sesión y la contabilización del uso de los subagentes.

Los precios del almacenamiento de prompts en caché varían según el modelo. Consulta los precios de la API para conocer las tarifas vigentes de entrada en caché y escritura en caché. La tarifa de escritura en caché no es un cargo adicional: a los tokens de entrada se les aplica la tarifa de entrada sin caché, entrada en caché o escritura en caché.

¿Qué es la caché de prompts?

Cuando el modelo procesa tokens de entrada, debe calcular estados intermedios, conocidos como estados de clave-valor (KV). Estos estados permiten al modelo consultar tokens anteriores mientras procesa nuevas entradas y genera tokens de salida.

El almacenamiento de prompts en caché conserva ese estado para un prefijo reutilizable: los tokens al inicio de un prompt que no cambian. Cuando una solicitud posterior tiene el mismo prefijo y encuentra una entrada de caché coincidente, el modelo puede reutilizar el estado guardado en lugar de volver a procesar esos tokens. Aun así, debe procesar cualquier entrada nueva para generar una nueva respuesta.

La caché de prompts almacena tensores de clave-valor (KV), no los tokens en sí.

Pídele a ChatGPT una explicación más detallada

OpenAI almacena en caché todo el contexto renderizado del modelo, incluidas las instrucciones proporcionadas por OpenAI, los mensajes del desarrollador, las definiciones de herramientas y el historial de conversación que contiene texto, imágenes, documentos y audio compatible.

Para reutilizar la caché, todo el prefijo renderizado debe coincidir. Si el contenido o una opción de configuración relevante cambia antes de un punto de corte, el prefijo a partir de ese cambio no puede coincidir con la entrada de caché existente.

Cómo funciona el almacenamiento en caché

Un punto de corte de caché marca el final de un prefijo de prompt que OpenAI puede guardar en caché y reutilizar en solicitudes posteriores. La primera solicitud escribe en caché un prefijo que cumple los requisitos y las solicitudes posteriores buscan el prefijo coincidente más largo que esté disponible en caché, recorriendo hacia atrás los puntos de corte válidos hasta encontrar una coincidencia.

Un prefijo de prompt debe alcanzar la longitud mínima de tokens que el modelo puede almacenar en caché antes de poder guardarse en ella. Los tokens del contenido de sistema oculto proporcionado por OpenAI no cuentan para este mínimo. La longitud mínima de un prompt que puede almacenarse en caché es de 1024 tokens para GPT-5.6 y versiones posteriores; en los modelos anteriores, varía según la configuración de la solicitud. Consulta la comparación de modelos para obtener más información.

Una vez alcanzada la longitud mínima de tokens que se puede almacenar en caché, puedes elegir explícitamente dónde colocar los puntos de corte de caché o dejar que OpenAI elija sus ubicaciones de forma implícita. Las opciones disponibles dependen del modelo.

Cómo funciona la coincidencia de prefijos

OpenAI recorre únicamente los límites de consulta de caché (explicados a continuación) de la solicitud entrante, desde el prefijo más largo hasta el más corto, en busca de un prefijo coincidente que ya esté almacenado en caché y disponible en la máquina.

Para GPT-5.6 y modelos posteriores, los límites de consulta de caché de la solicitud entrante son:

  • Modo exclusivamente explícito: los primeros 2 y los últimos 50 puntos de corte explícitos.
  • Modo implícito: los primeros 2 y los últimos 50 puntos de corte explícitos, el punto de corte implícito, los finales de hasta 20 mensajes anteriores que cumplan los requisitos y el final del bloque inicial de mensajes consecutivos del desarrollador. Esto permite que el modo implícito reutilice un prefijo que termina en un mensaje anterior sin que haya puntos de corte explícitos en esa posición.
Generación del modelo
Modo de almacenamiento en caché

Los puntos de corte implícitos se colocan en el último mensaje del usuario que cumple los requisitos.

Sistema ocultoHerramientasDesarrolladorHistorial de contextoSeguimientoEntrada en cachéEntrada sin caché
Longitud mínima para almacenar en caché (varía según el modelo)

Solicitud 1

12,000 tokens de entrada
3,000 tokens(ilustrativo)

Solicitud 2

15,000 tokens de entrada
3,000 tokens(ilustrativo)
0
2.5k
5k
7.5k
10k
12.5k
15k
17.5k
20k
Tokens de entrada (incluidos los tokens ocultos ilustrativos)
15,000
Último punto de corte coincidente
3,000
Tokens ocultos
=
12,000
Tokens en caché informados

Tiempo de vida de la caché

Las entradas de caché no se almacenan indefinidamente. Una solicitud posterior puede reutilizar un prefijo almacenado en caché solo mientras su entrada siga disponible, y reutilizar el prefijo renueva su tiempo de vida sin otro cargo por escritura en caché. La configuración del tiempo de vida y de la retención depende del modelo.

Ubicación de la caché

Los estados almacenados en caché residen en máquinas individuales, donde un tráfico superior a 15 solicitudes por minuto puede hacer que las solicitudes se enruten a otras máquinas por exceso de carga. Una solicitud puede reutilizar un prefijo almacenado en caché solo si llega a una máquina que tiene una entrada coincidente que no haya vencido. Por eso, enrutar las solicitudes a la máquina adecuada es importante para reutilizar la caché.

Las cachés no se comparten entre organizaciones ni se pueden reutilizar entre distintas regiones de procesamiento.

OpenAI gestiona el enrutamiento automáticamente. Dentro de una organización y una región de procesamiento, el enrutamiento para un modelo determinado depende de:

  • La carga actual de la máquina y su capacidad disponible.
  • Un hash de los tokens iniciales que siguen al contenido oculto de OpenAI, incluidas las definiciones de herramientas cuando están presentes. La cantidad de tokens que se usan para calcular el hash varía según el modelo.
  • Una clave prompt_cache_key proporcionada, que separa la reutilización de la caché entre grupos de solicitudes y ayuda a optimizar el enrutamiento de caché en los modelos anteriores a GPT-5.6.

Resumen de las diferencias entre modelos

ComportamientoGPT-5.6 y posterioresGPT-5.5 y GPT-5.5 ProOtros modelos anteriores
Puntos de corte implícitosAl final del mensaje más reciente que cumple los requisitos.Espaciados a intervalos regulares de 2048 tokens.Espaciados a intervalos regulares que dependen del modelo.
Puntos de corte explícitosAdmitidosNo admitidosNo admitidos
prompt_cache_keyOpcional para contabilizar por separado el uso de la cachéUsa una clave estable para optimizar el enrutamiento de cachéUsa una clave estable para optimizar el enrutamiento de caché
Prefijo mínimo que se puede almacenar en caché1024 tokens de entrada visiblesVaría según la configuración de la solicitudVaría según la configuración de la solicitud
Recuento de tokens en cachéLímite exacto que cumple los requisitos, sin incluir los tokens ocultosExcluye los tokens ocultos y redondea hacia abajo a un múltiplo de 128Excluye los tokens ocultos y redondea hacia abajo a un múltiplo de 128
Cargo por lectura de caché0,1× la tarifa de tokens de entrada sin cachéTarifa de entrada en caché que depende del modeloTarifa de entrada en caché que depende del modelo
Cargo por escritura en caché1,25× la tarifa de tokens de entrada sin cachéSin cargo adicional por escritura en cachéSin cargo adicional por escritura en caché
Control del tiempo de vida de la cachéprompt_cache_options.ttlprompt_cache_retentionprompt_cache_retention
Valores de retención admitidos"30m"Solo "24h""in_memory" o "24h"*
Tiempo de vida de la cachéAl menos 30 minutos después de la escritura o reutilización más recientePor lo general, unos 30 minutos, hasta un máximo de 24 horasPor lo general, de 5 a 10 minutos de inactividad para in_memory, o hasta 24 horas para 24h

* La retención extendida es compatible con gpt-5.5, gpt-5.5-pro, gpt-5.4, gpt-5.2, gpt-5.1-codex-max, gpt-5.1, gpt-5.1-codex, gpt-5.1-codex-mini, gpt-5.1-chat-latest, gpt-5, gpt-5-codex y gpt-4.1.

En los modelos anteriores a GPT-5.6, la longitud mínima de entrada que se puede almacenar en caché varía según la configuración de la solicitud, incluidas las herramientas, las imágenes, los esquemas de salida, el esfuerzo de razonamiento y el nivel de detalle.

Pedirle a ChatGPT que determine la longitud mínima que se puede almacenar en caché para mi solicitud

Cómo optimizar el almacenamiento de prompts en caché

Enfócate en preservar el historial de la conversación, mantener estables las definiciones de herramientas y elegir dónde se realiza el almacenamiento en caché. En GPT-5.6 y modelos posteriores, usa prompt_cache_options.mode y prompt_cache_breakpoint para controlar los puntos de corte de caché. También puedes usar una clave prompt_cache_key opcional si tu aplicación necesita contabilizar por separado el uso de la caché de sus clientes. En los modelos anteriores a GPT-5.6, usa una clave prompt_cache_key estable para optimizar el enrutamiento de caché de las solicitudes que comparten un prefijo reutilizable.

Pedirle a ChatGPT que optimice mi almacenamiento de prompts en caché

Ejemplos

Los siguientes ejemplos se aplican a GPT-5.6 y modelos posteriores.

Aspectos a tener en cuenta

Preguntas frecuentes