Benchmark · coding

Aider Polyglot

27 résultats 25 modèles

Aider Polyglot est un benchmark d'édition de code issu de l'outil de codage Aider qui teste dans quelle mesure un LLM édite du code existant dans de nombreux langages de programmation. Le score est le pourcentage de tâches dont les modifications produisent un code correct qui passe les tests de la tâche.

En savoir plus
Exemple
Un item typique est un exercice de programmation de style Exercism dans l'un de plusieurs langages (Python, Rust, Go, Java, JavaScript ou C++), où le modèle doit éditer les fichiers source fournis pour implémenter la fonction demandée et faire passer les tests.
Notation
La métrique est le pourcentage de tâches résolues : une tâche ne compte que si le code édité passe tous ses tests automatiques. Aider suit aussi la fréquence à laquelle les modifications reviennent dans le format correct et applicable.
Vérification
Les résultats sont vérifiés automatiquement : les fichiers édités sont exécutés contre la suite de tests unitaires de l'exercice, et une tâche n'est réussie que si tous les tests passent — sans vote humain ni comparaison par correspondance exacte.
Pourquoi c'est important
Il reflète le flux de travail réel d'un développeur — éditer des fichiers existants dans de nombreux langages plutôt qu'écrire des extraits à partir de zéro —, ce qui en fait un signal concret de l'utilité d'un modèle comme assistant de codage.
Exemple résolu
Tâche
Aider Polyglot tire des exercices d'Exercism dans 6 langages : le modèle reçoit l'énoncé d'un problème et un fichier squelette (p. ex. acronym.py contenant def abbreviate(words): ...) et doit l'éditer pour que la suite de tests pytest cachée passe. Exemple d'énoncé : convertir une phrase en son acronyme — 'Portable Network Graphics' → 'PNG', en traitant espaces, traits d'union et underscores comme des séparateurs et en ignorant le reste de la ponctuation.
Solution
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
Explication
L'expression régulière extrait les jetons de mots (lettres plus apostrophes internes), prend la première lettre de chaque jeton, la met en majuscule et les concatène, d'où 'Portable Network Graphics' → 'PNG'. La notation exécute les tests unitaires cachés de l'exercice ; l'item ne compte que si tous passent (aider rapporte pass@2 sur la suite).
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
Chronologie
Date Modèle Score Source
2026-08-06 Argus 76.8% Argus : un runtime agentique polyvalent pour le raisonnement à long terme
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5 domine le benchmark Aider Polyglot avec 88% grâce à un effort de raisonnement élevé
2026-03-10 o3-pro 84.9% GPT-5 domine le benchmark Aider Polyglot avec 88% grâce à un effort de raisonnement élevé
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5 domine le benchmark Aider Polyglot avec 88% grâce à un effort de raisonnement élevé
2026-03-10 Claude Sonnet 4 61.0% GPT-5 domine le benchmark Aider Polyglot avec 88% grâce à un effort de raisonnement élevé
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5 domine le benchmark Aider Polyglot avec 88% grâce à un effort de raisonnement élevé
2026-03-10 o4-mini 80.8% GPT-5 domine le benchmark Aider Polyglot avec 88% grâce à un effort de raisonnement élevé
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% Alibaba lance Qwen3-Coder-480B-A35B-Instruct, un modèle de codage open-source aux performances comparables aux modèles propriétaires
2025-08-20 DeepSeek V3.1 71.6% DeepSeek lance le modèle de raisonnement hybride V3.1 avec un taux de réussite Aider de 71,6 %
2025-08-07 GPT-5 88.0% OpenAI présente GPT-5 avec routage unifié et raisonnement de niveau expert
2025-08-07 GPT-5 88.0% OpenAI lance GPT-5 avec raisonnement adaptatif et architecture unifiée
2025-08-07 GPT‑5 88.0% OpenAI lance l'API GPT-5 avec des améliorations pour le codage et les agents
2025-07-10 Grok 4 Heavy 79.6% xAI publie Grok 4 avec un niveau Heavy multi-agents et des données web en direct
2025-06-05 Gemini 2.5 06-05 82.2% Google publie la version bêta Gemini 2.5 06-05 avec des améliorations en codage et raisonnement
2025-05-30 Deepseek-R1-0528 71.6% DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
2025-05-23 Claude Opus 4 72.0% Anthropic publie Claude Opus 4 et Sonnet 4 avec raisonnement hybride
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Les résultats du benchmark Qwen3 montrent les performances de codage chez divers fournisseurs
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Les résultats du benchmark Qwen3 montrent les performances de codage chez divers fournisseurs
2025-04-17 o4-mini-high 68.9% OpenAI lance o4-mini, un modèle de raisonnement multimodal plus rapide et moins cher
2025-04-14 GPT-4.1 52.9% OpenAI lance la famille GPT-4.1 avec un contexte de 1M de tokens et des améliorations en codage
2025-04-14 GPT‑4.1 nano 9.8% OpenAI lance GPT-4.1, GPT-4.1 mini et GPT-4.1 nano dans l'API
2025-03-26 Gemini 2.5 Pro 74.0% Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
2025-03-05 GPT-4.5 45.0% OpenAI publie GPT-4.5, son plus grand modèle, pour ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet établit un nouveau SOTA sur le benchmark polyglotte d'aider
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 en tête du nouveau classement de codage polyglotte difficile d'Aider