Benchmark · reasoning

ARC-AGI 2

33 परिणाम 28 मॉडल

ARC-AGI 2 (Abstraction & Reasoning Corpus, संस्करण 2, ARC Prize 2025 के रूप में आयोजित) fluid reasoning को मापता है: कुछ ही उदाहरणों से एक अमूर्त नियम का अनुमान लगाना और उसे किसी नए मामले पर लागू करना। स्कोर एक सुरक्षित, अर्ध-निजी मूल्यांकन सेट पर सही हल की गई पहेलियों का प्रतिशत है।

और पढ़ें
उदाहरण
एक कार्य में रंगीन grid के कुछ input→output जोड़े दिए जाते हैं (रंगीन कोशिकाओं का एक छोटा grid जो किसी एक सुसंगत तरीके से बदला गया हो), और हल करने वाले को छिपे हुए रूपांतरण का पता लगाकर नए input के लिए सही output grid बनाना होता है।
स्कोरिंग
हर पहेली पास/फेल होती है: बनाए गए output grid की तुलना बिलकुल सही grid से की जाती है, और बताया गया स्कोर अर्ध-निजी मूल्यांकन सेट पर हल की गई पहेलियों का प्रतिशत होता है।
सत्यापन
परिणाम output grid के exact match द्वारा स्वचालित रूप से जाँचे जाते हैं — अनुमानित grid को उत्तर से कोशिका-दर-कोशिका मेल खाना चाहिए — और यह एक अर्ध-निजी test set पर होता है जिसे रटने से रोकने के लिए सार्वजनिक नहीं किया जाता।
यह क्यों मायने रखता है
यह उन पहेलियों पर केंद्रित है जो इंसानों के लिए आसान पर AI के लिए कठिन हैं, इसलिए यह रटे-रटाए ज्ञान के बजाय असली अमूर्तन और सामान्य तर्क का एक बारीकी से देखा जाने वाला मापदंड है।
हल किया गया उदाहरण
कार्य
ARC-AGI-2 ग्रिड पहेली: प्रशिक्षण जोड़ों से रूपांतरण का अनुमान लगाएँ, फिर परीक्षण इनपुट के लिए आउटपुट ग्रिड दें (अंक 0–9 रंग हैं, 0 = काली पृष्ठभूमि)। प्रशिक्षण 1: [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]। प्रशिक्षण 2: [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]। परीक्षण: [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
समाधान
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
व्याख्या
हर प्रशिक्षण जोड़ा एक ही नियम दिखाता है — 'गुरुत्वाकर्षण': हर रंगीन कोशिका अपने कॉलम की सबसे नीचे की खाली कोशिकाओं तक सीधे गिरती है, रंग और संख्या बनाए रखते हुए, जबकि पृष्ठभूमि (0) ऊपर चली जाती है। परीक्षण में, कॉलम 0 के दो 5 और कॉलम 2 के दो 2 सबसे नीचे की दो पंक्तियों में बैठ जाते हैं। ARC-AGI-2 सटीक ग्रिड मिलान से आकलन करता है — सही आयाम और हर कोशिका का मान — pass@2 (दो अनुमत प्रयास) के आधार पर स्कोर।
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-03 Inkling-Small 40.1% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-07-06 Gemini 3 Pro 54.0% ARC-AGI-2 के लिए मॉडैलिटी-ड्रिवन खोज और होलिस्टिक ट्रेस जजिंग
2026-07-06 GPT-5.2 Pro 54.2% ARC-AGI-2 के लिए मॉडैलिटी-ड्रिवन खोज और होलिस्टिक ट्रेस जजिंग
2026-04-25 GPT-5.5 85.0% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2 ने दिसंबर 2025 में ARC-AGI-2 बेंचमार्क पर ~53% हासिल किया
2026-04-16 Confluence Lab 97.9% GPT-5.2 ने दिसंबर 2025 में ARC-AGI-2 बेंचमार्क पर ~53% हासिल किया
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2 ने दिसंबर 2025 में ARC-AGI-2 बेंचमार्क पर ~53% हासिल किया
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2 ने दिसंबर 2025 में ARC-AGI-2 बेंचमार्क पर ~53% हासिल किया
2026-04-16 GPT-5.2 53.0% GPT-5.2 ने दिसंबर 2025 में ARC-AGI-2 बेंचमार्क पर ~53% हासिल किया
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2 ने दिसंबर 2025 में ARC-AGI-2 बेंचमार्क पर ~53% हासिल किया
2026-02-19 Gemini 3.1 Pro 77.1% Google ने बेहतर तर्कशक्ति के साथ Gemini 3.1 Pro जारी किया
2026-02-12 Gemini 3 Deep Think 84.6% Google ने नए बेंचमार्क स्कोर के साथ अपग्रेडेड Gemini 3 Deep Think जारी किया
2026-02-05 Claude Opus 4.6 68.8% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI ने कोडिंग, लंबे-संदर्भ और तर्क क्षमताओं में सुधार के साथ GPT-5.2 पेश किया
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI ने GPT-5.2 जारी किया, जो कोडिंग और तर्कशीलता बेंचमार्क्स में Gemini 3 से बेहतर है
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% ARC Prize 2025 के परिणाम AGI प्रगति के लिए रीफाइनमेंट लूप को मुख्य बताते हैं
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% NVIDIA के शोधकर्ताओं ने किफ़ायती AGI तर्क के साथ Kaggle ARC Prize 2025 जीता
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq ने मेटा-सिस्टम का उपयोग करके आधे खर्च पर ARC-AGI-2 पर 54% हासिल किया
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% ARC Prize 2025 के परिणाम AGI प्रगति के लिए रीफाइनमेंट लूप को मुख्य बताते हैं
2025-12-05 Tiny Recursive Model (TRM) 8.0% ARC Prize 2025 के परिणाम AGI प्रगति के लिए रीफाइनमेंट लूप को मुख्य बताते हैं
2025-11-18 Gemini 3 Deep Think 45.1% Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-11-18 Gemini 3 Deep Think 45.1% Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-10-06 TRM 8.0% टिनी रिकर्सिव मॉडल (TRM) ने 7M पैरामीटर वाले LLMs की तुलना में उच्चतर ARC-AGI सटीकता हासिल की
2025-09-16 Grok-4 29.4% ARC-AGI v2 SoTA को Grok-4 के साथ अंग्रेजी निर्देशों के विकास द्वारा स्थापित किया गया
2025-08-15 HRM 2.0% विश्लेषण पाता है कि HRM का ARC-AGI प्रदर्शन बाहरी लूप परिष्करण और स्मृति द्वारा संचालित है
2025-08-08 Grok 4 15.9% xAI Grok 4 ने GPT5 के मुकाबले Arc-AGI2 बेंचमार्क में 15.9% स्कोर से अग्रता हासिल की
2025-07-09 Grok 4 15.9% xAI ने स्केल्ड रीइन्फोर्समेंट लर्निंग और नेटिव टूल यूज़ के साथ Grok 4 जारी किया
2025-04-22 o4-mini-medium 3.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o4-mini-low 3.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o3-medium 3.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-04-22 o3-low 3.0% ARC Prize Foundation ने ARC-AGI बेंचमार्क पर OpenAI o3 और o4-mini का मूल्यांकन किया
2025-03-24 public AI reasoning systems 9.0% ARC Prize Foundation ने ARC-AGI-2 बेंचमार्क और ARC Prize 2025 लॉन्च किया
2024-12-20 o3 tuned high 87.0% OpenAI ने ARC AGI और Frontier Math में सफलता के साथ o3 तर्क मॉडल का प्रीव्यू दिया