Benchmark · reasoning

ARC-AGI 1

28 परिणाम 26 मॉडल

ARC-AGI 1 अमूर्त तर्क और सामान्यीकरण को मापता है: हर टास्क में कुछ input→output ग्रिड उदाहरण दिए जाते हैं, और हल करने वाले को छिपे हुए रूपांतरण नियम का अनुमान लगाकर किसी नए इनपुट के लिए सही आउटपुट ग्रिड बनाना होता है। मीट्रिक वह प्रतिशत है जिसमें आउटपुट ग्रिड बिल्कुल मेल खाने के साथ टास्क हल हुए।

और पढ़ें
उदाहरण
एक टास्क में दो या तीन छोटी रंगीन ग्रिड हो सकती हैं जहाँ हर इनपुट एक ही नियम से अपने आउटपुट में बदलता है — जैसे हर बंद क्षेत्र को भरना या किसी आकृति को दर्पण की तरह पलटना — और उसी अनुमानित नियम को एक नई, पहले न देखी गई ग्रिड पर लागू करना होता है।
स्कोरिंग
कोई टास्क तभी हल माना जाता है जब बनाई गई ग्रिड संदर्भ उत्तर से हर सेल तक बिल्कुल मेल खाए; अंतिम स्कोर पूरे मूल्यांकन सेट में हल हुए टास्क का अंश (प्रतिशत) होता है।
सत्यापन
जाँच स्वचालित और सटीक होती है: प्रस्तुत आउटपुट ग्रिड की तुलना सही ग्रिड से सेल-दर-सेल की जाती है, न कोई आंशिक अंक और न ही मानव मतदान।
यह क्यों मायने रखता है
ये पहेलियाँ इस तरह बनाई गई हैं कि इंसानों के लिए आसान हों पर याद किए गए पैटर्न पर निर्भर मॉडलों के लिए कठिन, इसलिए यह बेंचमार्क याद किए ज्ञान के बजाय असली अमूर्तता और few-shot सामान्यीकरण को परखता है — जिससे यह अधिक सामान्य AI की दिशा में प्रगति का एक बारीकी से देखा जाने वाला माप बन जाता है।
हल किया गया उदाहरण
कार्य
ARC-AGI 1 पहले कुछ इनपुट→आउटपुट ग्रिड उदाहरण दिखाता है, फिर एक छिपा हुआ टेस्ट इनपुट देता है; आपको रूपांतरण का अनुमान लगाकर सटीक आउटपुट ग्रिड बनाना है (कोशिकाएँ रंग 0-9, 0=काला)। उदाहरण एक स्व-फ्रैक्टल नियम दिखाते हैं: हर 3×3 ग्रिड 9×9 में फैलता है — जहाँ कोशिका रंगीन है वहाँ पूरे ग्रिड की एक प्रति छापी जाती है और जहाँ 0 है वहाँ खाली 3×3 ब्लॉक। टेस्ट इनपुट (3×3): 0 8 0 / 8 8 8 / 0 8 0 (रंग 8 का एक प्लस)।
समाधान
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
व्याख्या
रंग 8 वाली कोशिकाएँ प्लस की चारों भुजाओं के मध्य-बिंदुओं और केंद्र पर हैं; प्लस को ठीक इन पाँच 3×3 ब्लॉकों में छापना (और चारों कोने खाली रखना) 9×9 फ्रैक्टल बनाता है। ARC-AGI केवल कोशिका-दर-कोशिका पूर्ण मिलान पर अंक देता है — एक भी गलत कोशिका पर कार्य विफल, अधिकतम 2 प्रयास मान्य।
0 24.5 49 73.5 98 2024-06-17 2025-07-25 2026-09-02 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 Claude Sonnet 3.5 · 53.6 · 2024-12-18 MIT & Cornell team · 47.5 · 2024-12-18 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3 tuned low · 76 · 2024-12-20 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-high · 88 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-medium · 53 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o3-preview-low · 76 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 CompressARC · 20 · 2025-12-05 Tiny Recursive Model (TRM) · 45 · 2025-12-05 GPT-5.2 Thinking · 86.2 · 2025-12-11 GPT-5.2 Pro · 90.5 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 small transformer · 44 · 2026-09-02 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 Claude Sonnet 3.5 MIT & Cornell team o3 o3 tuned low o3-preview (low) o3-preview (high) o3-preview-high o3-low o3-medium o4-mini-low o4-mini-medium o3-preview-low HRM Grok-4 TRM CompressARC Tiny Recursive Model (TRM) GPT-5.2 Thinking GPT-5.2 Pro Opus 4.6 small transformer OpenAI o3 (low compute) OpenAI o3 (high compute)
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-02 small transformer 44.0% Anthropic ने Claude Fable 5.1 को मजबूत कोडिंग क्षमताओं के साथ जारी किया
2026-04-16 o3 75.0% GPT-5.2 ने दिसंबर 2025 में ARC-AGI-2 बेंचमार्क पर ~53% हासिल किया
2026-03-09 Opus 4.6 93.0% ARC-AGI बेंचमार्क पर 2-3x प्रदर्शन गिरावट मिली, भले ही लागत 390x कम हुई हो
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
2025-12-11 GPT-5.2 Pro 90.5% OpenAI ने GPT-5.2 जारी किया, जो कोडिंग और तर्कशीलता बेंचमार्क्स में Gemini 3 से बेहतर है
2025-12-05 CompressARC 20.0% ARC Prize 2025 के परिणाम AGI प्रगति के लिए रीफाइनमेंट लूप को मुख्य बताते हैं
2025-12-05 Tiny Recursive Model (TRM) 45.0% ARC Prize 2025 के परिणाम AGI प्रगति के लिए रीफाइनमेंट लूप को मुख्य बताते हैं
2025-10-06 TRM 45.0% टिनी रिकर्सिव मॉडल (TRM) ने 7M पैरामीटर वाले LLMs की तुलना में उच्चतर ARC-AGI सटीकता हासिल की
2025-09-16 Grok-4 79.6% ARC-AGI v2 SoTA को Grok-4 के साथ अंग्रेजी निर्देशों के विकास द्वारा स्थापित किया गया
2025-08-15 HRM 32.0% विश्लेषण पाता है कि HRM का ARC-AGI प्रदर्शन बाहरी लूप परिष्करण और स्मृति द्वारा संचालित है
2025-04-22 o3-preview-high 88.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o3-low 41.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o3-medium 53.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o4-mini-low 21.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o4-mini-medium 41.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o3-preview-low 76.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-20 o3-preview (low) 75.7% OpenAI का o3 FrontierMath पर शुरुआती दावे से कम स्कोर करता है
2025-04-20 o3-preview (high) 87.5% OpenAI का o3 FrontierMath पर शुरुआती दावे से कम स्कोर करता है
2024-12-20 o3 75.7% OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
2024-12-20 o3 tuned low 76.0% OpenAI ने ARC AGI और Frontier Math में सफलता के साथ o3 तर्क मॉडल का प्रीव्यू दिया
2024-12-20 o3 75.7% OpenAI o3 ने ARC-AGI-Pub पर ब्रेकथ्रू स्कोर हासिल किए
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 Claude Sonnet 3.5 53.6% जेरेमी बर्मान और MIT/कोर्नेल टीम ने ARC-AGI-Pub पर नया राज्य-कला हासिल किया
2024-12-18 MIT & Cornell team 47.5% जेरेमी बर्मान और MIT/कोर्नेल टीम ने ARC-AGI-Pub पर नया राज्य-कला हासिल किया
2024-12-06 MindsAI 55.5% ARC Prize 2024 के विजेता प्रकाशित; ARC-AGI-1 पर SOTA बढ़कर 55.5% हो गया
2024-12-06 Sonnet 3.5.1 53.6% जेरेमी बर्मान ने एवोल्यूशनरी टेस्ट-टाइम कंप्यूट के साथ सनेट 3.5 का उपयोग करके ARC-AGI-Pub पर 53.6% हासिल किए
2024-06-17 GPT-4o 50.0% GPT-4o ने भारी सैंपलिंग के माध्यम से ARC-AGI पर 50% SoTA हासिल किया