ベンチマーク · coding

Aider Polyglot

27 結果 25 モデル

Aider Polyglot は、コーディングツール Aider によるコード編集ベンチマークで、LLM が多くのプログラミング言語で既存コードをどれだけうまく編集できるかを測ります。スコアは、編集によって正しいコードが生成され、その課題のテストに合格した課題の割合です。

詳しく見る
典型的な項目は、Python、Rust、Go、Java、JavaScript、C++ などの複数言語のいずれかで出される Exercism 風のコーディング演習で、モデルは与えられたソースファイルを編集して必要な関数を実装し、テストに合格させる必要があります。
採点方法
指標は解けた課題の割合です。編集後のコードがその課題のすべての自動テストに合格したときだけ、その課題は成功とみなされます。Aider は、編集が正しく適用可能な形式で返される頻度も記録します。
検証方法
結果は自動的に判定されます。編集されたファイルを各演習のユニットテスト一式に対して実行し、すべてのテストに合格した場合にのみ課題は合格となります——人による投票や完全一致の比較はありません。
重要な理由
これは実際の開発者のワークフロー——ゼロから断片を書くのではなく、多くの言語で既存ファイルを編集すること——を反映しているため、モデルがコーディング支援としてどれだけ役立つかの実用的な指標になります。
解説付きの例
課題
Aider Polyglot は 6 言語にわたる Exercism の演習を用いる。モデルは問題仕様とスタブファイル(例: def abbreviate(words): ... を含む acronym.py)を受け取り、隠された pytest テストスイートが通るように編集しなければならない。仕様例: フレーズを頭字語に変換する — 'Portable Network Graphics' → 'PNG'。空白・ハイフン・アンダースコアを区切りとみなし、その他の句読点は無視する。
解答
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
解説
正規表現が単語トークン(英字と語中のアポストロフィ)を取り出し、各トークンの先頭文字を取って大文字化し連結するので 'Portable Network Graphics' → 'PNG' となる。採点は演習の隠れたユニットテストを実行し、全テストが通った場合のみ得点する(aider はスイート全体で pass@2 を報告)。
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
タイムライン
日付 モデル スコア ソース
2026-08-06 Argus 76.8% Argus: 長期推論のための汎用エージェントランタイム
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5、Aider Polyglotベンチマークで88%を達成し高い推論努力で首位
2026-03-10 o3-pro 84.9% GPT-5、Aider Polyglotベンチマークで88%を達成し高い推論努力で首位
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5、Aider Polyglotベンチマークで88%を達成し高い推論努力で首位
2026-03-10 Claude Sonnet 4 61.0% GPT-5、Aider Polyglotベンチマークで88%を達成し高い推論努力で首位
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5、Aider Polyglotベンチマークで88%を達成し高い推論努力で首位
2026-03-10 o4-mini 80.8% GPT-5、Aider Polyglotベンチマークで88%を達成し高い推論努力で首位
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% アリババ、独自モデルに匹敵する性能を持つオープンソースのコーディングモデル「Qwen3-Coder-480B-A35B-Instruct」をリリース
2025-08-20 DeepSeek V3.1 71.6% DeepSeekが71.6%のAiderパス率を持つハイブリッド推論モデルV3.1をリリース
2025-08-07 GPT-5 88.0% OpenAIが統一ルーティングと専門レベルの推論を備えたGPT-5を発表
2025-08-07 GPT-5 88.0% OpenAIが適応的推論と統一アーキテクチャを搭載したGPT-5をリリース
2025-08-07 GPT‑5 88.0% OpenAIがコーディングおよびエージェント機能の改善されたGPT-5 APIをリリース
2025-07-10 Grok 4 Heavy 79.6% xAIがGrok 4をリリース、重厚なマルチエージェント層とライブWebデータを搭載
2025-06-05 Gemini 2.5 06-05 82.2% Google、コーディングと推論の強化されたGemini 2.5 06-05プレビューをリリース
2025-05-30 Deepseek-R1-0528 71.6% DeepSeekがR1モデルを更新し、推論能力とベンチマークスコアを向上
2025-05-23 Claude Opus 4 72.0% Anthropicがハイブリッド推論機能を備えたClaude Opus 4およびSonnet 4をリリース
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Qwen3ベンチマーク結果はプロバイダー間でコーディングパフォーマンスを示す
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Qwen3ベンチマーク結果はプロバイダー間でコーディングパフォーマンスを示す
2025-04-17 o4-mini-high 68.9% OpenAIが高速で低コストなマルチモーダル推論モデルo4-miniをリリース
2025-04-14 GPT-4.1 52.9% OpenAIが100万トークンのコンテキストとコーディング改善を備えたGPT-4.1ファミリーをリリース
2025-04-14 GPT‑4.1 nano 9.8% OpenAIがAPIでGPT-4.1、GPT-4.1 mini、GPT-4.1 nanoをリリース
2025-03-26 Gemini 2.5 Pro 74.0% Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース
2025-03-05 GPT-4.5 45.0% OpenAI、ChatGPT Plus向けに最大規模モデルGPT-4.5をリリース
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnetがaiderの多言語ベンチマークでSOTAを樹立
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 が Aider の新しい挑戦的な多言語コーディングリーダーボードで首位に