벤치마크 · coding

Aider Polyglot

27 결과 25 모델

Aider Polyglot은 코딩 도구 Aider에서 만든 코드 편집 벤치마크로, LLM이 여러 프로그래밍 언어에서 기존 코드를 얼마나 잘 편집하는지 측정합니다. 점수는 편집 결과가 올바른 코드가 되어 해당 과제의 테스트를 통과한 과제의 비율입니다.

자세히 보기
예시
전형적인 항목은 Python, Rust, Go, Java, JavaScript, C++ 등 여러 언어 중 하나로 주어지는 Exercism 스타일 코딩 연습으로, 모델은 제공된 소스 파일을 편집해 요구된 함수를 구현하고 테스트를 통과시켜야 합니다.
채점 방식
지표는 해결한 과제의 비율입니다. 편집된 코드가 그 과제의 모든 자동 테스트를 통과할 때에만 과제가 해결된 것으로 집계되며, Aider는 편집이 올바르고 적용 가능한 형식으로 돌아오는 빈도도 추적합니다.
검증 방식
결과는 자동으로 검증됩니다. 편집된 파일을 각 연습의 단위 테스트 모음에 대해 실행하고, 모든 테스트를 통과할 때에만 과제가 통과됩니다 — 사람의 투표나 정확 일치 비교는 없습니다.
왜 중요한가
이는 실제 개발자 워크플로우 — 처음부터 코드 조각을 작성하는 것이 아니라 여러 언어에서 기존 파일을 편집하는 것 — 를 반영하므로, 모델이 코딩 보조 도구로서 얼마나 유용한지를 보여주는 실용적인 신호입니다.
예제 풀이
문제
Aider Polyglot 은 6개 언어에 걸친 Exercism 연습 문제를 사용한다. 모델은 문제 명세와 스텁 파일(예: def abbreviate(words): ... 이 든 acronym.py)을 받고, 숨겨진 pytest 테스트 스위트가 통과하도록 편집해야 한다. 명세 예시: 구를 두문자어로 변환 — 'Portable Network Graphics' → 'PNG'. 공백, 하이픈, 밑줄은 구분자로 보고 나머지 구두점은 무시한다.
해답
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
풀이
정규식이 단어 토큰(문자와 단어 내부의 apostrophe)을 뽑아 각 토큰의 첫 글자를 대문자로 바꿔 이어 붙이므로 'Portable Network Graphics' → 'PNG' 가 된다. 채점은 연습의 숨겨진 단위 테스트를 실행하며, 모든 테스트가 통과할 때만 해당 항목이 득점한다(aider 는 스위트 전체에 대해 pass@2 를 보고).
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
타임라인
날짜 모델 점수 출처
2026-08-06 Argus 76.8% Argus: 장기적 추론을 위한 범용 에이전트 런타임
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5, Aider Polyglot 벤치마크에서 높은 추론 노력으로 88% 달성
2026-03-10 o3-pro 84.9% GPT-5, Aider Polyglot 벤치마크에서 높은 추론 노력으로 88% 달성
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5, Aider Polyglot 벤치마크에서 높은 추론 노력으로 88% 달성
2026-03-10 Claude Sonnet 4 61.0% GPT-5, Aider Polyglot 벤치마크에서 높은 추론 노력으로 88% 달성
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5, Aider Polyglot 벤치마크에서 높은 추론 노력으로 88% 달성
2026-03-10 o4-mini 80.8% GPT-5, Aider Polyglot 벤치마크에서 높은 추론 노력으로 88% 달성
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% 알리바바, 독점 모델 수준의 성능을 갖춘 오픈소스 코딩 모델 'Qwen3-Coder-480B-A35B-Instruct' 출시
2025-08-20 DeepSeek V3.1 71.6% DeepSeek, 71.6% Aider 통과율을 가진 하이브리드 추론 모델 V3.1 출시
2025-08-07 GPT-5 88.0% OpenAI가 통합 라우팅과 전문가 수준의 추론을 갖춘 GPT-5를 출시하다
2025-08-07 GPT-5 88.0% OpenAI, 적응형 추론과 통합 아키텍처를 갖춘 GPT-5 출시
2025-08-07 GPT‑5 88.0% OpenAI, 코딩 및 에이전트 개선된 GPT-5 API 출시
2025-07-10 Grok 4 Heavy 79.6% xAI, 무거운 다중 에이전트 티어와 실시간 웹 데이터를 갖춘 Grok 4 출시
2025-06-05 Gemini 2.5 06-05 82.2% 구글, 코딩 및 추론 업그레이드가 적용된 Gemini 2.5 06-05 프리뷰 출시
2025-05-30 Deepseek-R1-0528 71.6% DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
2025-05-23 Claude Opus 4 72.0% Anthropic, 하이브리드 추론 기능을 갖춘 Claude Opus 4와 Sonnet 4 출시
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Qwen3 벤치마크 결과, 제공업체 간 코딩 성능 보여줘
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Qwen3 벤치마크 결과, 제공업체 간 코딩 성능 보여줘
2025-04-17 o4-mini-high 68.9% OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시
2025-04-14 GPT-4.1 52.9% OpenAI, 100만 토큰 컨텍스트 및 코딩 개선 기능을 갖춘 GPT-4.1 패밀리 출시
2025-04-14 GPT‑4.1 nano 9.8% OpenAI, API에 GPT-4.1, GPT-4.1 mini, GPT-4.1 nano 출시
2025-03-26 Gemini 2.5 Pro 74.0% 구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
2025-03-05 GPT-4.5 45.0% 오픈에이아이, 차트GPT 플러스용 최대 규모 모델 GPT-4.5 출시
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet이 aider의 다국어 벤치마크에서 SOTA 달성
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1, Aider의 새로운 도전적인 다국어 코딩 리더보드 정상 등극