Benchmark · coding

Aider Polyglot

27 परिणाम 25 मॉडल

Aider Polyglot, Aider कोडिंग टूल का एक कोड-एडिटिंग बेंचमार्क है जो जाँचता है कि कोई LLM कई प्रोग्रामिंग भाषाओं में मौजूदा कोड को कितनी अच्छी तरह एडिट करता है। स्कोर उन कार्यों का प्रतिशत है जिनके एडिट सही कोड बनाते हैं और कार्य के टेस्ट पास कर लेते हैं।

और पढ़ें
उदाहरण
एक सामान्य आइटम कई भाषाओं में से किसी एक (Python, Rust, Go, Java, JavaScript या C++) में Exercism-शैली का कोडिंग अभ्यास होता है, जहाँ मॉडल को दी गई सोर्स फ़ाइलों को एडिट करके आवश्यक फ़ंक्शन लागू करना होता है ताकि उसके टेस्ट पास हों।
स्कोरिंग
मेट्रिक हल किए गए कार्यों का प्रतिशत है: कोई कार्य तभी गिना जाता है जब एडिट किया गया कोड उसके सभी स्वचालित टेस्ट पास कर ले। Aider यह भी ट्रैक करता है कि एडिट कितनी बार सही, लागू-होने-योग्य फ़ॉर्मैट में आते हैं।
सत्यापन
परिणाम स्वचालित रूप से जाँचे जाते हैं: एडिट की गई फ़ाइलों को अभ्यास के यूनिट-टेस्ट सूट पर चलाया जाता है, और कोई कार्य तभी पास होता है जब हर टेस्ट पास हो — कोई मानवीय वोट या सटीक-मिलान तुलना नहीं।
यह क्यों मायने रखता है
यह एक असली डेवलपर वर्कफ़्लो को दर्शाता है — शुरू से स्निपेट लिखने के बजाय कई भाषाओं में मौजूदा फ़ाइलों को एडिट करना — इसलिए यह इस बात का व्यावहारिक संकेत है कि कोई मॉडल कोडिंग असिस्टेंट के रूप में कितना उपयोगी है।
हल किया गया उदाहरण
कार्य
Aider Polyglot 6 भाषाओं में Exercism से अभ्यास लेता है: मॉडल को एक समस्या का विवरण और एक stub फ़ाइल मिलती है (जैसे def abbreviate(words): ... वाली acronym.py), और उसे इस तरह संपादित करना होता है कि छिपा हुआ pytest टेस्ट-सूट पास हो जाए। उदाहरण विवरण: किसी वाक्यांश को उसके संक्षिप्त रूप में बदलें — 'Portable Network Graphics' → 'PNG', जहाँ स्पेस, हाइफ़न और अंडरस्कोर विभाजक माने जाएँ और बाकी विराम-चिह्न अनदेखा किए जाएँ।
समाधान
import re

def abbreviate(words):
    return "".join(w[0].upper() for w in re.findall(r"[A-Za-z']+", words))
व्याख्या
regex शब्द-टोकन (अक्षर और शब्द के भीतर के apostrophe) निकालता है, हर टोकन का पहला अक्षर लेकर उसे बड़े अक्षर में करता है और जोड़ देता है, जिससे 'Portable Network Graphics' → 'PNG'। मूल्यांकन अभ्यास के छिपे यूनिट टेस्ट चलाता है; आइटम को अंक तभी मिलते हैं जब सभी टेस्ट पास हों (aider पूरे सूट पर pass@2 रिपोर्ट करता है)।
0 23.5 47 70.5 94 2024-12-21 2025-10-13 2026-08-06 o1 · 62 · 2024-12-21 R1+Sonnet · 64 · 2025-01-24 GPT-4.5 · 45 · 2025-03-05 Gemini 2.5 Pro · 74 · 2025-03-26 Gemini 2.5 Pro · 83.1 · 2026-03-10 GPT-4.1 · 52.9 · 2025-04-14 GPT‑4.1 nano · 9.8 · 2025-04-14 o4-mini-high · 68.9 · 2025-04-17 Qwen3 235B A22B whole, no think, via official Alibaba API · 61.8 · 2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings · 65.3 · 2025-05-08 Claude Opus 4 · 72 · 2025-05-23 Deepseek-R1-0528 · 71.6 · 2025-05-30 Gemini 2.5 06-05 · 82.2 · 2025-06-05 Grok 4 Heavy · 79.6 · 2025-07-10 GPT-5 · 88 · 2025-08-07 GPT-5 · 88 · 2025-08-07 GPT‑5 · 88 · 2025-08-07 DeepSeek V3.1 · 71.6 · 2025-08-20 Qwen3-Coder-480B-A35B-Instruct · 61.8 · 2025-10-17 GPT-5 with high reasoning effort · 88 · 2026-03-10 o3-pro · 84.9 · 2026-03-10 Claude Sonnet 4 · 61 · 2026-03-10 GPT-5 with medium reasoning · 81.3 · 2026-03-10 o4-mini · 80.8 · 2026-03-10 Argus · 76.8 · 2026-08-06 DeepSeek R1 · 56.9 · 2025-01-20 Claude 3.7 Sonnet · 64.9 · 2025-02-24
o1 R1+Sonnet GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 nano o4-mini-high Qwen3 235B A22B whole, no think, via official Alibaba API Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings Claude Opus 4 Deepseek-R1-0528 Gemini 2.5 06-05 Grok 4 Heavy GPT-5 GPT‑5 DeepSeek V3.1 Qwen3-Coder-480B-A35B-Instruct GPT-5 with high reasoning effort o3-pro Claude Sonnet 4 GPT-5 with medium reasoning o4-mini Argus DeepSeek R1 Claude 3.7 Sonnet
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-06 Argus 76.8% Argus: दीर्घकालिक तर्क के लिए एक सामान्य-उद्देश्य एजेंटिक रनटाइम
2026-03-10 GPT-5 with high reasoning effort 88.0% उच्च तर्क प्रयास के साथ GPT-5 ने Aider Polyglot बेंचमार्क में 88% के साथ शीर्ष स्थान हासिल किया
2026-03-10 o3-pro 84.9% उच्च तर्क प्रयास के साथ GPT-5 ने Aider Polyglot बेंचमार्क में 88% के साथ शीर्ष स्थान हासिल किया
2026-03-10 Gemini 2.5 Pro 83.1% उच्च तर्क प्रयास के साथ GPT-5 ने Aider Polyglot बेंचमार्क में 88% के साथ शीर्ष स्थान हासिल किया
2026-03-10 Claude Sonnet 4 61.0% उच्च तर्क प्रयास के साथ GPT-5 ने Aider Polyglot बेंचमार्क में 88% के साथ शीर्ष स्थान हासिल किया
2026-03-10 GPT-5 with medium reasoning 81.3% उच्च तर्क प्रयास के साथ GPT-5 ने Aider Polyglot बेंचमार्क में 88% के साथ शीर्ष स्थान हासिल किया
2026-03-10 o4-mini 80.8% उच्च तर्क प्रयास के साथ GPT-5 ने Aider Polyglot बेंचमार्क में 88% के साथ शीर्ष स्थान हासिल किया
2025-10-17 Qwen3-Coder-480B-A35B-Instruct 61.8% अलibaba ने Qwen3-Coder-480B-A35B-Instruct जारी किया, एक ओपन-सोर्स कोडिंग मॉडल जो प्रोप्राइटरी प्रदर्शन के बराबर है
2025-08-20 DeepSeek V3.1 71.6% DeepSeek ने 71.6% Aider पास रेट के साथ हाइब्रिड तर्क मॉडल V3.1 जारी किया
2025-08-07 GPT-5 88.0% OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
2025-08-07 GPT-5 88.0% ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
2025-08-07 GPT‑5 88.0% OpenAI ने कोडिंग और एजेंटिक सुधारों के साथ GPT-5 API जारी किया
2025-07-10 Grok 4 Heavy 79.6% xAI ने Grok 4 को भारी बहु-एजेंट स्तर और लाइव वेब डेटा के साथ जारी किया
2025-06-05 Gemini 2.5 06-05 82.2% Google ने कोडिंग और तर्क में सुधार के साथ Gemini 2.5 06-05 प्रीव्यू जारी किया
2025-05-30 Deepseek-R1-0528 71.6% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-23 Claude Opus 4 72.0% Anthropic ने हाइब्रिड तर्कशक्ति के साथ Claude Opus 4 और Sonnet 4 जारी किए
2025-05-08 Qwen3 235B A22B whole, no think, via official Alibaba API 61.8% Qwen3 बेंचमार्क परिणाम विभिन्न प्रदाताओं में कोडिंग प्रदर्शन दिखाते हैं
2025-05-08 Qwen3-235B-A22B whole with VLLM, bfloat16, recommended /no_think settings 65.3% Qwen3 बेंचमार्क परिणाम विभिन्न प्रदाताओं में कोडिंग प्रदर्शन दिखाते हैं
2025-04-17 o4-mini-high 68.9% OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2025-04-14 GPT-4.1 52.9% OpenAI ने GPT-4.1 परिवार को 1M टोकन संदर्भ और कोडिंग सुधारों के साथ जारी किया
2025-04-14 GPT‑4.1 nano 9.8% OpenAI ने API में GPT-4.1, GPT-4.1 mini और GPT-4.1 nano लॉन्च किए
2025-03-26 Gemini 2.5 Pro 74.0% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-05 GPT-4.5 45.0% OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
2025-02-24 Claude 3.7 Sonnet 64.9% Aider leaderboard
2025-01-24 R1+Sonnet 64.0% R1+Sonnet ने aider के बहुभाषी बेंचमार्क पर SOTA स्थापित किया
2025-01-20 DeepSeek R1 56.9% Aider leaderboard
2024-12-21 o1 62.0% OpenAI o1 ने Aider के नए चुनौतीपूर्ण बहुभाषी कोडिंग लीडरबोर्ड में शीर्ष स्थान हासिल किया