Benchmark · coding

Aider Polyglot

27 条结果 25 个模型

Aider Polyglot 是来自 Aider 编程工具的代码编辑基准,用于测试 LLM 在多种编程语言中编辑现有代码的能力。得分是编辑后能产生正确代码并通过该任务测试的任务所占的百分比。

了解更多
示例
一个典型题目是采用 Exercism 风格的编程练习,使用 Python、Rust、Go、Java、JavaScript 或 C++ 等多种语言之一,模型需要编辑所提供的源文件,实现所要求的函数,使其测试通过。
评分方式
指标是解决任务的百分比:只有当编辑后的代码通过该任务的全部自动化测试时,该任务才算完成。Aider 还会跟踪编辑以正确、可应用格式返回的频率。
验证方式
结果由自动方式判定:编辑后的文件针对每个练习的单元测试套件运行,只有全部测试通过,该任务才算通过——没有人工投票,也没有精确匹配比较。
为何重要
它反映了真实的开发者工作流程——在多种语言中编辑现有文件,而不是从零编写片段——因此能切实反映一个模型作为编程助手有多大用处。
示例解析
任务
Aider Polyglot 从 Exercism 抽取涵盖 6 种语言的练习:模型拿到题目说明和一个桩文件(例如含 def abbreviate(words): ...acronym.py),必须编辑它使隐藏的 pytest 测试套件通过。示例题目:将短语转换为其首字母缩写——'Portable Network Graphics' → 'PNG',把空格、连字符和下划线视为分隔符并忽略其他标点。
解答
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
解析
正则表达式提取单词记号(字母加词内撇号),取每个记号的首字母,转为大写并拼接,于是 'Portable Network Graphics' → 'PNG'。评分会运行该练习隐藏的单元测试;只有全部测试通过该题才得分(aider 在整个套件上报告 pass@2)。
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
时间线
日期 模型 得分 来源
2026-08-06 Argus 76.8% Argus:面向长程推理的通用代理运行时
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5 在高推理努力下以 88% 的成绩领先 Aider Polyglot 基准测试
2026-03-10 o3-pro 84.9% GPT-5 在高推理努力下以 88% 的成绩领先 Aider Polyglot 基准测试
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5 在高推理努力下以 88% 的成绩领先 Aider Polyglot 基准测试
2026-03-10 Claude Sonnet 4 61.0% GPT-5 在高推理努力下以 88% 的成绩领先 Aider Polyglot 基准测试
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5 在高推理努力下以 88% 的成绩领先 Aider Polyglot 基准测试
2026-03-10 o4-mini 80.8% GPT-5 在高推理努力下以 88% 的成绩领先 Aider Polyglot 基准测试
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% 阿里巴巴发布 Qwen3-Coder-480B-A35B-Instruct,开源编程模型性能媲美闭源模型
2025-08-20 DeepSeek V3.1 71.6% DeepSeek发布混合推理模型V3.1,Aider通过率71.6%
2025-08-07 GPT-5 88.0% OpenAI 推出 GPT-5,具备统一路由与专家级推理能力
2025-08-07 GPT-5 88.0% OpenAI 发布具备自适应推理与统一架构的 GPT-5
2025-08-07 GPT‑5 88.0% OpenAI发布GPT-5 API,增强编码与智能体能力
2025-07-10 Grok 4 Heavy 79.6% xAI发布Grok 4,配备重型多智能体层级和实时网络数据
2025-06-05 Gemini 2.5 06-05 82.2% Google 发布 Gemini 2.5 06-05 预览版,带来编码与推理能力升级
2025-05-30 Deepseek-R1-0528 71.6% DeepSeek更新R1模型,提升推理能力与基准测试成绩
2025-05-23 Claude Opus 4 72.0% Anthropic发布Claude Opus 4和Sonnet 4,引入混合推理能力
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Qwen3基准测试结果显示不同提供商的代码性能
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Qwen3基准测试结果显示不同提供商的代码性能
2025-04-17 o4-mini-high 68.9% OpenAI发布o4-mini:一款更快、更便宜的多模态推理模型
2025-04-14 GPT-4.1 52.9% OpenAI发布GPT-4.1系列,支持100万token上下文并改进编码能力
2025-04-14 GPT‑4.1 nano 9.8% OpenAI在API中推出GPT-4.1、GPT-4.1 mini和GPT-4.1 nano
2025-03-26 Gemini 2.5 Pro 74.0% Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
2025-03-05 GPT-4.5 45.0% OpenAI发布GPT-4.5,其为ChatGPT Plus推出的最大模型
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet在aider的多语言基准测试中创下SOTA纪录
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 在 Aider 新发布的极具挑战性的多语言编程排行榜中登顶