Anthropic rapporte que son modèle amélioré Claude 3.5 Sonnet a obtenu un score de 49 % sur le benchmark SWE-bench Verified, dépassant le score précédent de pointe de 45 %. L'article détaille le système « agent » construit autour du modèle pour aider les développeurs à optimiser les performances.

  • SWE-bench Verified est un sous-ensemble de 500 tâches d'ingénierie logicielle révisées qui testent la capacité d'un modèle à résoudre des problèmes GitHub dans des dépôts Python.
  • La philosophie de conception de l'agent privilégie le contrôle du modèle de langage avec un minimum de scaffolding, en utilisant les outils Bash et Edit.
  • Les descriptions des outils ont été affinées pour éviter les malentendus, comme exiger des chemins absolus pour éviter les erreurs lors du déplacement de répertoires.
  • Le système échantillonne jusqu'à ce que le modèle décide qu'il a terminé ou dépasse sa longueur de contexte de 200k.

L'article vise à aider les développeurs à comprendre l'architecture de l'agent afin d'obtenir les meilleures performances possibles de Claude 3.5 Sonnet sur les tâches de codage.