OpenAI ha lanzado un sistema mejorado de almacenamiento en caché de prompts para la familia GPT-6 que ofrece tasas de acierto de caché más altas por defecto y proporciona descuentos de hasta el 90% en los tokens de entrada almacenados en caché. La actualización introduce nuevas herramientas para ayudar a los desarrolladores a monitorizar el rendimiento, diagnosticar fallos de caché y optimizar sus integraciones.
- Los descuentos de caché se aplican ahora a los prefijos compartidos elegibles reutilizados dentro de una ventana de 30 minutos.
- El Panel de Control de Almacenamiento en Caché permite rastrear las tasas de acierto a lo largo del tiempo y comparar tokens almacenados versus no almacenados en caché.
- Una herramienta de diagnóstico ayuda a identificar las causas de los fallos de caché, como cambios en las herramientas o configuraciones.
- Los puntos de interrupción explícitos de caché permiten a los desarrolladores elegir prefijos específicos del prompt para reutilizar.
- El esfuerzo de razonamiento se puede ajustar entre respuestas sin romper la caché mediante actualizaciones de configuración.
- Las capacidades de precalentamiento permiten preparar el contexto conocido con antelación para reducir la latencia.
Estas características ayudan a que los agentes persistentes funcionen más rápido y cuesten menos al maximizar la reutilización de instrucciones compartidas, definiciones de herramientas y contexto entre las solicitudes de API.