OpenAI a lancé la famille de modèles GPT-5.6, conçue pour offrir des performances d'agent de pointe à des coûts nettement inférieurs en optimisant l'effort de raisonnement et en introduisant de nouveaux contrôles API. Cette mise à jour permet aux startups de construire des agents plus rapides et plus capables en utilisant des modèles plus petits comme Luna et Terra pour les tâches à fort volume, tout en réservant les modèles plus grands pour le jugement complexe.
- GPT-5.6 Sol avec un raisonnement « low » surpasse GPT-5.5 avec un raisonnement « high » sur l'Agents’ Last Exam dans des conditions de harnais constantes.
- Sur le benchmark BrowseComp, GPT-5.6 Luna a obtenu 84,04 % pour 1,33 $, comparé aux 84,36 % de GPT-5.5 pour 33,27 $.
- Les nouvelles primitives de l'API Responses incluent le raisonnement persistant, la compaction native, l'orchestration multi-agents et l'appel d'outils programmatique.
- L'activation du raisonnement conservé et de la compaction sur ARC-AGI-3 a augmenté le score de GPT-5.6 Sol de 13,3 % à 38,3 % tout en utilisant environ 6 fois moins de tokens de sortie.
- Le TTL du cache de prompts est étendu à un minimum de 30 minutes avec des points de cassure de cache déterministes pour améliorer les taux de réussite et réduire la latence.
Ces changements modifient l'économie de la construction d'agents, permettant d'obtenir des résultats comparables ou supérieurs à une fraction du coût grâce à l'utilisation de modèles plus petits et de choix architecturaux efficaces.