Claude Code v2.1.181 introduit la prise en charge de la définition des paramètres de configuration via la syntaxe de prompt comme /config thinking=false, ajoute le support des événements Apple dans les sandbox sur macOS, et améliore le streaming, la nouvelle tentative automatique et le comportement du sous-agent. Il corrige également de nombreux bugs liés au démarrage, à la gestion des fichiers, au presse-papiers et à la réactivité de l'interface utilisateur sur toutes les plateformes.
Notes de version de Claude Code v2.1.181
L'étude de facturation de Claude Code montre que la réduction du contexte n'abaisse pas les coûts
Une étude portant sur 2 848 exécutions facturées par le fournisseur de Claude Code révèle que la réduction du contexte récupéré ou de la sortie des outils n'abaisse pas de manière fiable le coût facturé réel des agents de codage. La recherche remet en question la métrique d'évaluation courante de la suppression de texte en analysant une campagne de 2 908 exécutions sur trois modèles et sept dépôts.
Suivi : DeepSeek V4 Flash sur 2x RTX PRO 6000 termine les tâches de codage réelles plus rapidement que Sonnet et Opus, avec une qualité approximativement équivalente à celle de Sonnet
Un benchmark de suivi évalue DeepSeek V4 Flash exécuté sur deux GPU RTX PRO 6000 en utilisant vLLM, comparant ses performances dans des tâches de codage réelles par rapport aux modèles basés sur API comme Claude Sonnet et Opus. L'étude révèle que bien qu'Opus et Fable maintiennent une qualité de code supérieure, DeepSeek V4 Flash atteint une qualité approximativement au niveau de Sonnet avec des temps d'exécution significativement plus courts.
TestEvo-Bench : Un benchmark exécutable et en temps réel pour la co-évolution des tests et du code
Les auteurs présentent TestEvo-Bench, un benchmark en temps réel conçu pour évaluer la capacité des agents d'automatisation des tests à gérer la co-évolution du code et des tests. Il comble les lacunes des benchmarks existants en fournissant des tâches exécutables ancrées dans des historiques de commits réels avec des configurations d'environnement.
Claude Code v2.1.235 ajoute la vérification orthographique, corrige le cache des invites et les bugs de l'interface utilisateur
La version 2.1.235 de Claude Code introduit une fonctionnalité de vérification orthographique optionnelle pour la saisie des invites et résout plusieurs problèmes liés à la mise en cache des invites, à l'alignement de l'interface utilisateur et aux dialogues d'autorisation.
DeepSeek V4 Pro 0813 vs Claude Fable 5 sur DeepSWE : coût, codage et routage
Une comparaison de DeepSeek V4 Pro 0813 et Claude Fable 5 sur le benchmark DeepSWE révèle qu'une stratégie de routage utilisant les deux modèles résout 82,7 % des tâches à 8,28 $ chacune, surpassant Fable seul (69,7 %) tout en étant nettement moins cher.