Benchmark · coding

Aider Polyglot

27 نتائج 25 نماذج

Aider Polyglot هو معيار لتحرير الشيفرة من أداة البرمجة Aider يختبر مدى جودة تحرير نموذج LLM لشيفرة موجودة عبر العديد من لغات البرمجة. النتيجة هي نسبة المهام التي تُنتج تعديلاتُها شيفرة صحيحة تجتاز اختبارات المهمة.

اقرأ المزيد
مثال
العنصر النموذجي هو تمرين برمجي على نمط Exercism بإحدى عدة لغات (Python أو Rust أو Go أو Java أو JavaScript أو C++)، حيث يجب على النموذج تحرير ملفات المصدر المقدَّمة لتنفيذ الدالة المطلوبة كي تجتاز اختباراتها.
طريقة التقييم
المقياس هو نسبة المهام المحلولة: لا تُحتسب المهمة إلا عندما تجتاز الشيفرة المحرَّرة جميع اختباراتها الآلية. كما يتتبع Aider عدد المرات التي تعود فيها التعديلات بالتنسيق الصحيح القابل للتطبيق.
التحقق
تُتحقَّق النتائج آليًا: تُشغَّل الملفات المحرَّرة على مجموعة اختبارات الوحدة لكل تمرين، ولا تنجح المهمة إلا إذا اجتازت جميع الاختبارات — دون تصويت بشري أو مقارنة بالتطابق التام.
لماذا يهم
إنه يحاكي سير عمل المطوّر الحقيقي — تحرير ملفات موجودة عبر العديد من اللغات بدلاً من كتابة مقاطع من الصفر — لذا فهو مؤشر عملي على مدى فائدة النموذج كمساعد برمجي.
مثال محلول
المهمة
يأخذ Aider Polyglot تمارين من Exercism عبر 6 لغات: يحصل النموذج على وصف المسألة وملف هيكلي (مثل acronym.py يحتوي على def abbreviate(words): ...) وعليه تحريره حتى تنجح مجموعة اختبارات pytest المخفية. مثال على الوصف: تحويل عبارة إلى اختصارها الأولي — 'Portable Network Graphics' → 'PNG'، مع اعتبار المسافات والشرطات والشرطات السفلية فواصل وتجاهل بقية علامات الترقيم.
الحل
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
الشرح
يستخرج التعبير النمطي (regex) رموز الكلمات (الأحرف مع الفواصل العليا داخل الكلمة)، ويأخذ الحرف الأول من كل رمز ويحوّله إلى حرف كبير ثم يدمجها، فيصبح 'Portable Network Graphics' → 'PNG'. يشغّل التقييم اختبارات الوحدة المخفية للتمرين، ولا تُحتسب المسألة إلا إذا نجحت كل الاختبارات (يبلّغ aider عن pass@2 على المجموعة كاملة).
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-06 Argus 76.8% أرجوس: بيئة تشغيل عميلية عامة الغرض للاستدلال طويل المدى
2026-03-10 GPT-5 with high reasoning effort 88.0% GPT-5 يتصدر benchmark Aider Polyglot بنسبة 88% بجهد استدلال عالٍ
2026-03-10 o3-pro 84.9% GPT-5 يتصدر benchmark Aider Polyglot بنسبة 88% بجهد استدلال عالٍ
2026-03-10 Gemini 2.5 Pro 83.1% GPT-5 يتصدر benchmark Aider Polyglot بنسبة 88% بجهد استدلال عالٍ
2026-03-10 Claude Sonnet 4 61.0% GPT-5 يتصدر benchmark Aider Polyglot بنسبة 88% بجهد استدلال عالٍ
2026-03-10 GPT-5 with medium reasoning 81.3% GPT-5 يتصدر benchmark Aider Polyglot بنسبة 88% بجهد استدلال عالٍ
2026-03-10 o4-mini 80.8% GPT-5 يتصدر benchmark Aider Polyglot بنسبة 88% بجهد استدلال عالٍ
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% أليبابا تطلق Qwen3-Coder-480B-A35B-Instruct، نموذج برمجة مفتوح المصدر يعادل أداء النماذج الخاصة
2025-08-20 DeepSeek V3.1 71.6% ديبسيك تطلق نموذج الاستدلال الهجين V3.1 بمعدل نجاح Aider بنسبة 71.6%
2025-08-07 GPT-5 88.0% OpenAI تطرح GPT-5 بتوجيه موحد واستدلال على مستوى الخبراء
2025-08-07 GPT-5 88.0% أوبن إيه آي تطلق جي بي تي-5 بمنطق تكيفي وهندسة معمارية موحدة
2025-08-07 GPT‑5 88.0% OpenAI تطلق واجهة برمجة تطبيقات GPT-5 بتحسينات في البرمجة والوكلاء
2025-07-10 Grok 4 Heavy 79.6% xAI تطلق غروك 4 بترتيب "الثقيل" متعدد الوكلاء وبيانات الويب المباشرة
2025-06-05 Gemini 2.5 06-05 82.2% جوجل تطلق النسخة التجريبية من جيميناي 2.5 بتاريخ 06-05 بترقيات في البرمجة والاستدلال
2025-05-30 Deepseek-R1-0528 71.6% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-05-23 Claude Opus 4 72.0% أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% تظهر نتائج معيار Qwen3 أداء البرمجة عبر مزودي الخدمة
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% تظهر نتائج معيار Qwen3 أداء البرمجة عبر مزودي الخدمة
2025-04-17 o4-mini-high 68.9% OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص
2025-04-14 GPT-4.1 52.9% OpenAI تطلق عائلة GPT-4.1 مع سياق يتكون من مليون توكن وتحسينات في البرمجة
2025-04-14 GPT‑4.1 nano 9.8% OpenAI تُطلق GPT-4.1 وGPT-4.1 mini وGPT-4.1 nano عبر واجهة برمجة التطبيقات
2025-03-26 Gemini 2.5 Pro 74.0% جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
2025-03-05 GPT-4.5 45.0% OpenAI تطلق GPT-4.5، أكبر نموذج لها، لـ ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet يحقق رقماً قياسياً جديداً في اختبار aider متعدد اللغات
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 يتصدر قائمة الترتيب الجديدة الصعبة متعددة اللغات للبرمجة من Aider