OpenAI a lancé un système amélioré de mise en cache des invites pour la famille GPT-6 qui offre par défaut des taux de succès en cache plus élevés et propose des réductions allant jusqu'à 90 % sur les tokens d'entrée mis en cache. Cette mise à jour introduit de nouveaux outils pour aider les développeurs à surveiller les performances, diagnostiquer les échecs de cache et optimiser leurs intégrations.

  • Les réductions de cache sont désormais appliquées pour les préfixes partagés éligibles réutilisés dans une fenêtre de 30 minutes.
  • Le tableau de bord Prompt Caching permet de suivre les taux de succès au fil du temps et de comparer les tokens mis en cache par rapport à ceux qui ne le sont pas.
  • Un outil de diagnostic aide à identifier les causes des échecs de cache, tels que des modifications des outils ou des paramètres.
  • Des points de rupture de cache explicites permettent aux développeurs de choisir des préfixes d'invite spécifiques à réutiliser.
  • L'effort de raisonnement peut être ajusté entre les réponses sans interrompre le cache grâce à des mises à jour de configuration.
  • Les capacités de préchauffage permettent de préparer un contexte connu à l'avance pour réduire la latence.

Ces fonctionnalités aident les agents persistants à s'exécuter plus rapidement et à moindre coût en maximisant la réutilisation des instructions partagées, des définitions d'outils et du contexte entre les requêtes API.