OpenAI ha lanzado un sistema mejorado de almacenamiento en caché de prompts para la familia GPT-6 que ofrece tasas de acierto de caché más altas por defecto y proporciona descuentos de hasta el 90% en los tokens de entrada almacenados en caché. La actualización introduce nuevas herramientas para ayudar a los desarrolladores a monitorizar el rendimiento, diagnosticar fallos de caché y optimizar sus integraciones.

  • Los descuentos de caché se aplican ahora a los prefijos compartidos elegibles reutilizados dentro de una ventana de 30 minutos.
  • El Panel de Control de Almacenamiento en Caché permite rastrear las tasas de acierto a lo largo del tiempo y comparar tokens almacenados versus no almacenados en caché.
  • Una herramienta de diagnóstico ayuda a identificar las causas de los fallos de caché, como cambios en las herramientas o configuraciones.
  • Los puntos de interrupción explícitos de caché permiten a los desarrolladores elegir prefijos específicos del prompt para reutilizar.
  • El esfuerzo de razonamiento se puede ajustar entre respuestas sin romper la caché mediante actualizaciones de configuración.
  • Las capacidades de precalentamiento permiten preparar el contexto conocido con antelación para reducir la latencia.

Estas características ayudan a que los agentes persistentes funcionen más rápido y cuesten menos al maximizar la reutilización de instrucciones compartidas, definiciones de herramientas y contexto entre las solicitudes de API.