Benchmark · reasoning

ARC-AGI 1

27 परिणाम 25 मॉडल

ARC-AGI 1 अमूर्त तर्क और सामान्यीकरण को मापता है: हर टास्क में कुछ input→output ग्रिड उदाहरण दिए जाते हैं, और हल करने वाले को छिपे हुए रूपांतरण नियम का अनुमान लगाकर किसी नए इनपुट के लिए सही आउटपुट ग्रिड बनाना होता है। मीट्रिक वह प्रतिशत है जिसमें आउटपुट ग्रिड बिल्कुल मेल खाने के साथ टास्क हल हुए।

और पढ़ें
उदाहरण
एक टास्क में दो या तीन छोटी रंगीन ग्रिड हो सकती हैं जहाँ हर इनपुट एक ही नियम से अपने आउटपुट में बदलता है — जैसे हर बंद क्षेत्र को भरना या किसी आकृति को दर्पण की तरह पलटना — और उसी अनुमानित नियम को एक नई, पहले न देखी गई ग्रिड पर लागू करना होता है।
स्कोरिंग
कोई टास्क तभी हल माना जाता है जब बनाई गई ग्रिड संदर्भ उत्तर से हर सेल तक बिल्कुल मेल खाए; अंतिम स्कोर पूरे मूल्यांकन सेट में हल हुए टास्क का अंश (प्रतिशत) होता है।
सत्यापन
जाँच स्वचालित और सटीक होती है: प्रस्तुत आउटपुट ग्रिड की तुलना सही ग्रिड से सेल-दर-सेल की जाती है, न कोई आंशिक अंक और न ही मानव मतदान।
यह क्यों मायने रखता है
ये पहेलियाँ इस तरह बनाई गई हैं कि इंसानों के लिए आसान हों पर याद किए गए पैटर्न पर निर्भर मॉडलों के लिए कठिन, इसलिए यह बेंचमार्क याद किए ज्ञान के बजाय असली अमूर्तता और few-shot सामान्यीकरण को परखता है — जिससे यह अधिक सामान्य AI की दिशा में प्रगति का एक बारीकी से देखा जाने वाला माप बन जाता है।
हल किया गया उदाहरण
कार्य
ARC-AGI 1 पहले कुछ इनपुट→आउटपुट ग्रिड उदाहरण दिखाता है, फिर एक छिपा हुआ टेस्ट इनपुट देता है; आपको रूपांतरण का अनुमान लगाकर सटीक आउटपुट ग्रिड बनाना है (कोशिकाएँ रंग 0-9, 0=काला)। उदाहरण एक स्व-फ्रैक्टल नियम दिखाते हैं: हर 3×3 ग्रिड 9×9 में फैलता है — जहाँ कोशिका रंगीन है वहाँ पूरे ग्रिड की एक प्रति छापी जाती है और जहाँ 0 है वहाँ खाली 3×3 ब्लॉक। टेस्ट इनपुट (3×3): 0 8 0 / 8 8 8 / 0 8 0 (रंग 8 का एक प्लस)।
समाधान
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
व्याख्या
रंग 8 वाली कोशिकाएँ प्लस की चारों भुजाओं के मध्य-बिंदुओं और केंद्र पर हैं; प्लस को ठीक इन पाँच 3×3 ब्लॉकों में छापना (और चारों कोने खाली रखना) 9×9 फ्रैक्टल बनाता है। ARC-AGI केवल कोशिका-दर-कोशिका पूर्ण मिलान पर अंक देता है — एक भी गलत कोशिका पर कार्य विफल, अधिकतम 2 प्रयास मान्य।
0 24.5 49 73.5 98 2024-06-17 2025-05-17 2026-04-16 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Pro · 90.5 · 2025-12-11 GPT-5.2 Thinking · 86.2 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-medium o3-low o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Pro GPT-5.2 Thinking Opus 4.6 OpenAI o3 (low compute) OpenAI o3 (high compute)
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-04-16 o3 75.0% GPT-5.2 ने दिसंबर 2025 में ARC-AGI-2 बेंचमार्क पर ~53% हासिल किया
2026-03-09 Opus 4.6 93.0% ARC-AGI बेंचमार्क पर 2-3x प्रदर्शन गिरावट मिली, भले ही लागत 390x कम हुई हो
2025-12-11 GPT-5.2 Pro 90.5% OpenAI ने GPT-5.2 जारी किया, जो कोडिंग और तर्कशीलता बेंचमार्क्स में Gemini 3 से बेहतर है
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
2025-12-05 Tiny Recursive Model (TRM) 45.0% ARC Prize 2025 के परिणाम AGI प्रगति के लिए रीफाइनमेंट लूप को मुख्य बताते हैं
2025-12-05 CompressARC 20.0% ARC Prize 2025 के परिणाम AGI प्रगति के लिए रीफाइनमेंट लूप को मुख्य बताते हैं
2025-10-06 TRM 45.0% टिनी रिकर्सिव मॉडल (TRM) ने 7M पैरामीटर वाले LLMs की तुलना में उच्चतर ARC-AGI सटीकता हासिल की
2025-09-16 Grok-4 79.6% ARC-AGI v2 SoTA को Grok-4 के साथ अंग्रेजी निर्देशों के विकास द्वारा स्थापित किया गया
2025-08-15 HRM 32.0% विश्लेषण पाता है कि HRM का ARC-AGI प्रदर्शन बाहरी लूप परिष्करण और स्मृति द्वारा संचालित है
2025-04-22 o3-preview-low 76.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o4-mini-medium 41.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o4-mini-low 21.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o3-medium 53.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o3-low 41.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o3-preview-high 88.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-20 o3-preview (low) 75.7% OpenAI का o3 FrontierMath पर शुरुआती दावे से कम स्कोर करता है
2025-04-20 o3-preview (high) 87.5% OpenAI का o3 FrontierMath पर शुरुआती दावे से कम स्कोर करता है
2024-12-20 o3 tuned low 76.0% OpenAI ने ARC AGI और Frontier Math में सफलता के साथ o3 तर्क मॉडल का प्रीव्यू दिया
2024-12-20 o3 75.7% OpenAI o3 ने ARC-AGI-Pub पर ब्रेकथ्रू स्कोर हासिल किए
2024-12-20 o3 75.7% OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% जेरेमी बर्मान और MIT/कोर्नेल टीम ने ARC-AGI-Pub पर नया राज्य-कला हासिल किया
2024-12-18 Claude Sonnet 3.5 53.6% जेरेमी बर्मान और MIT/कोर्नेल टीम ने ARC-AGI-Pub पर नया राज्य-कला हासिल किया
2024-12-06 MindsAI 55.5% ARC Prize 2024 के विजेता प्रकाशित; ARC-AGI-1 पर SOTA बढ़कर 55.5% हो गया
2024-12-06 Sonnet 3.5.1 53.6% जेरेमी बर्मान ने एवोल्यूशनरी टेस्ट-टाइम कंप्यूट के साथ सनेट 3.5 का उपयोग करके ARC-AGI-Pub पर 53.6% हासिल किए
2024-06-17 GPT-4o 50.0% GPT-4o ने भारी सैंपलिंग के माध्यम से ARC-AGI पर 50% SoTA हासिल किया