Le modèle Claude 3.5 Sonnet mis à jour d'Anthropic a atteint 49 % sur le benchmark SWE-bench Verified, dépassant le score précédent de pointe de 45 %. L'article détaille le système « agent » construit autour du modèle pour obtenir ce résultat.

  • SWE-bench Verified est un sous-ensemble de 500 tâches d'ingénierie logicielle résolubles utilisé pour évaluer la capacité d'un agent IA à résoudre des problèmes GitHub dans des dépôts Python.
  • La philosophie de conception de l'agent privilégie le contrôle du modèle de langage avec un échafaudage minimal, en utilisant uniquement un Bash Tool et un Edit Tool.
  • Le système échantillonne les réponses jusqu'à ce que le modèle décide qu'il a terminé ou dépasse sa longueur de contexte de 200k.
  • Des descriptions détaillées des outils ont été élaborées pour éviter les incompréhensions, permettant au modèle de choisir son propre flux de travail plutôt que de suivre des motifs codés en dur.

Cette approche aide les développeurs à optimiser leur utilisation de Claude 3.5 Sonnet pour des tâches de codage complexes en démontrant comment un échafaudage minimal peut exploiter efficacement les capacités du modèle.