A OpenAI lançou um sistema aprimorado de cache de prompts para a família GPT-6 que oferece, por padrão, maiores taxas de acerto no cache e concede descontos de até 90% nos tokens de entrada em cache. A atualização introduz novas ferramentas para ajudar os desenvolvedores a monitorar o desempenho, diagnosticar falhas de cache e otimizar suas integrações.
- Os descontos do cache agora são aplicados para prefixos compartilhados elegíveis reutilizados dentro de uma janela de 30 minutos.
- O Painel de Controle do Prompt Caching permite acompanhar as taxas de acerto ao longo do tempo e comparar tokens em cache versus não em cache.
- Uma ferramenta de diagnóstico ajuda a identificar as causas das falhas de cache, como alterações nas ferramentas ou configurações.
- Ponto de interrupção explícito do cache permite que os desenvolvedores escolham prefixos específicos de prompts para reutilizar.
- O esforço de raciocínio pode ser ajustado entre as respostas sem quebrar o cache por meio de atualizações de configuração.
- As capacidades de pré-aquecimento permitem preparar o contexto conhecido com antecedência para reduzir a latência.
Esses recursos ajudam agentes persistentes a executar mais rápido e com menor custo, maximizando a reutilização de instruções compartilhadas, definições de ferramentas e contexto entre as solicitações da API.