OpenAI telah meluncurkan sistem caching prompt yang ditingkatkan untuk keluarga GPT-6 yang memberikan hit rate cache lebih tinggi secara default serta menawarkan diskon hingga 90% pada token input yang di-cache. Pembaruan ini memperkenalkan alat baru untuk membantu pengembang memantau kinerja, mendiagnosis kegagalan cache, dan mengoptimalkan integrasi mereka.

  • Diskon cache kini diterapkan untuk awalan bersama yang memenuhi syarat dan digunakan kembali dalam jendela waktu 30 menit.
  • Dasbor Prompt Caching memungkinkan pelacakan hit rate seiring waktu serta membandingkan token yang di-cache versus yang tidak di-cache.
  • Alat diagnostik membantu mengidentifikasi penyebab kegagalan cache, seperti perubahan pada alat atau pengaturan.
  • Titik putus cache eksplisit memungkinkan pengembang memilih awalan prompt tertentu untuk digunakan kembali.
  • Upaya penalaran dapat disesuaikan antar respons tanpa mengganggu cache melalui pembaruan konfigurasi.
  • Kemampuan prewarming memungkinkan persiapan konteks yang diketahui sebelumnya untuk mengurangi latensi.

Fitur-fitur ini membantu agen persisten berjalan lebih cepat dan lebih hemat biaya dengan memaksimalkan penggunaan ulang instruksi bersama, definisi alat, dan konteks di seluruh permintaan API.