Anthropic a publié la nouvelle génération de modèles Claude, Claude Opus 4 et Claude Sonnet 4, établissant de nouveaux records pour le codage, le raisonnement avancé et les flux de travail d'agents IA. Ces modèles hybrides offrent à la fois des réponses quasi instantanées et un mode de « réflexion étendue » pour un raisonnement plus approfondi, ainsi que de nouvelles capacités telles que l'exécution parallèle d'outils et une mémoire améliorée.
- Claude Opus 4 domine sur SWE-bench (72,5 %) et Terminal-bench (43,2 %), maintenant ses performances sur des tâches de longue durée pendant plusieurs heures.
- Claude Sonnet 4 atteint un record de 72,7 % sur SWE-bench, offrant un mélange optimal de capacités et d'efficacité en tant que mise à niveau par rapport à Sonnet 3.7.
- Les deux modèles prennent en charge la réflexion étendue avec l'utilisation d'outils en version bêta, leur permettant d'alterner entre le raisonnement et des actions telles que la recherche web.
- Claude Code est désormais généralement disponible avec des intégrations natives pour VS Code et JetBrains, ainsi qu'un nouveau SDK pour créer des agents personnalisés.
- Les nouvelles capacités de l'API incluent l'outil d'exécution de code, le connecteur MCP, l'API Files et la mise en cache des prompts pendant jusqu'à une heure.
Les modèles sont conçus pour faire avancer les stratégies IA en repoussant les limites du codage et de la recherche, tout en apportant des performances de pointe aux cas d'utilisation quotidiens grâce à une meilleure contrôlabilité et à la réduction des comportements de raccourci.