Бенчмарк · coding

Aider Polyglot

27 результатов 25 моделей

Aider Polyglot — бенчмарк редактирования кода из инструмента Aider, который проверяет, насколько хорошо LLM редактирует существующий код на многих языках программирования. Оценка — это доля задач, в которых правки дают корректный код, проходящий тесты задачи.

Подробнее
Пример
Типичный пункт — упражнение по программированию в стиле Exercism на одном из нескольких языков (Python, Rust, Go, Java, JavaScript или C++), где модель должна отредактировать предоставленные исходные файлы, чтобы реализовать нужную функцию и пройти её тесты.
Метрика
Метрика — процент решённых задач: задача засчитывается, только если отредактированный код проходит все автоматические тесты. Aider также отслеживает, как часто правки приходят в корректном, применимом формате.
Приёмка
Результаты проверяются автоматически: отредактированные файлы прогоняются через набор модульных тестов упражнения, и задача считается пройденной, только если проходят все тесты — без человеческих голосов и сравнения на точное совпадение.
Почему важно
Он отражает реальную работу разработчика — редактирование существующих файлов на многих языках, а не написание фрагментов с нуля, — поэтому это практический сигнал того, насколько модель полезна как помощник по программированию.
Разбор примера
Задача
Aider Polyglot берёт задачи из Exercism на 6 языках: модель получает описание задачи и файл-заготовку (например, acronym.py с def abbreviate(words): ...) и должна отредактировать его так, чтобы прошёл скрытый набор тестов pytest. Пример задания: преобразовать фразу в её аббревиатуру — 'Portable Network Graphics' → 'PNG', считая пробелы, дефисы и подчёркивания разделителями и игнорируя прочую пунктуацию.
Решение
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
Разбор
Регулярное выражение выделяет словесные токены (буквы плюс апострофы внутри слова), берёт первую букву каждого токена, переводит её в верхний регистр и склеивает, так что 'Portable Network Graphics' → 'PNG'. При проверке запускаются скрытые модульные тесты упражнения; пункт засчитывается, только если проходят все тесты (aider сообщает pass@2 по всему набору).
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
Хронология
Дата Модель Результат Источник
2026-08-06 Argus 76.8% Argus: Универсальная агентная среда выполнения для рассуждений на длительных горизонтах
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5 лидирует в бенчмарке Aider Polyglot с результатом 88% при высоком уровне рассуждений
2026-03-10 o3-pro 84.9% GPT-5 лидирует в бенчмарке Aider Polyglot с результатом 88% при высоком уровне рассуждений
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5 лидирует в бенчмарке Aider Polyglot с результатом 88% при высоком уровне рассуждений
2026-03-10 Claude Sonnet 4 61.0% GPT-5 лидирует в бенчмарке Aider Polyglot с результатом 88% при высоком уровне рассуждений
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5 лидирует в бенчмарке Aider Polyglot с результатом 88% при высоком уровне рассуждений
2026-03-10 o4-mini 80.8% GPT-5 лидирует в бенчмарке Aider Polyglot с результатом 88% при высоком уровне рассуждений
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% Alibaba выпустила Qwen3-Coder-480B-A35B-Instruct, модель для программирования с открытым исходным кодом, сопоставимую по производительности с проприетарными решениями
2025-08-20 DeepSeek V3.1 71.6% DeepSeek выпустила гибридную модель рассуждений V3.1 с показателем прохождения Aider 71,6%
2025-08-07 GPT-5 88.0% OpenAI представляет GPT-5 с единым маршрутизатором и рассуждениями экспертного уровня
2025-08-07 GPT-5 88.0% OpenAI запускает GPT-5 с адаптивным рассуждением и единой архитектурой
2025-08-07 GPT‑5 88.0% OpenAI выпустила API GPT-5 с улучшениями для кодинга и агентов
2025-07-10 Grok 4 Heavy 79.6% xAI выпустила Grok 4 с тяжёлым многоагентным тарифом и доступом к данным в реальном времени
2025-06-05 Gemini 2.5 06-05 82.2% Google выпустила превью Gemini 2.5 06-05 с улучшениями в области программирования и рассуждений
2025-05-30 Deepseek-R1-0528 71.6% DeepSeek обновляет модель R1 с улучшенными способностями к рассуждению и результатами на бенчмарках
2025-05-23 Claude Opus 4 72.0% Anthropic выпустила Claude Opus 4 и Sonnet 4 с гибридным рассуждением
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Результаты бенчмарков Qwen3 показывают производительность в кодировании у разных провайдеров
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Результаты бенчмарков Qwen3 показывают производительность в кодировании у разных провайдеров
2025-04-17 o4-mini-high 68.9% OpenAI выпустила o4-mini: более быструю и дешёвую мультимодальную модель рассуждений
2025-04-14 GPT-4.1 52.9% OpenAI выпустила семейство GPT-4.1 с контекстом на 1 млн токенов и улучшениями для программирования
2025-04-14 GPT‑4.1 nano 9.8% OpenAI запустила GPT-4.1, GPT-4.1 mini и GPT-4.1 nano в API
2025-03-26 Gemini 2.5 Pro 74.0% Google выпустила экспериментальную модель рассуждений Gemini 2.5 Pro с контекстом на 1 млн токенов
2025-03-05 GPT-4.5 45.0% OpenAI выпустила GPT-4.5, свою самую большую модель, для ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet установили новый рекорд в полиглотном бенчмарке aider
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 возглавил новый сложный полиглотный рейтинг Aider