OpenAI a présenté GPT-6 Sol et Luna comme des alternatives plus rapides et plus abordables à GPT-6 Astra, apportant des avancées en matière de codage, de factualité, d'utilisation informatique et de tâches professionnelles à des modèles à moindre coût.

  • Anthropic a publié Claude Opus 5.5, qui égale Claude Fable 5.1 sur la plupart des travaux tout en coûtant 40 % moins cher à exécuter qu'Opus 5.
  • SWE-Bench Pro V2 est publié avec 642 tâches provenant de 11 dépôts, corrigeant les erreurs de tâches précédentes et optimisant les processus d'évaluation.
  • Google a introduit RRSI, une méthode qui régularise la façon dont les agents IA s'améliorent récursivement pour réduire le surajustement aux benchmarks.

Ces mises à jour offrent aux utilisateurs des options de modèles plus rentables et de nouveaux benchmarks rigoureux pour évaluer les performances de l'IA.