Benchmark · reasoning
ARC-AGI 2
ARC-AGI 2 (Abstraction & Reasoning Corpus, संस्करण 2, ARC Prize 2025 के रूप में आयोजित) fluid reasoning को मापता है: कुछ ही उदाहरणों से एक अमूर्त नियम का अनुमान लगाना और उसे किसी नए मामले पर लागू करना। स्कोर एक सुरक्षित, अर्ध-निजी मूल्यांकन सेट पर सही हल की गई पहेलियों का प्रतिशत है।
और पढ़ें
- उदाहरण
- एक कार्य में रंगीन grid के कुछ input→output जोड़े दिए जाते हैं (रंगीन कोशिकाओं का एक छोटा grid जो किसी एक सुसंगत तरीके से बदला गया हो), और हल करने वाले को छिपे हुए रूपांतरण का पता लगाकर नए input के लिए सही output grid बनाना होता है।
- स्कोरिंग
- हर पहेली पास/फेल होती है: बनाए गए output grid की तुलना बिलकुल सही grid से की जाती है, और बताया गया स्कोर अर्ध-निजी मूल्यांकन सेट पर हल की गई पहेलियों का प्रतिशत होता है।
- सत्यापन
- परिणाम output grid के exact match द्वारा स्वचालित रूप से जाँचे जाते हैं — अनुमानित grid को उत्तर से कोशिका-दर-कोशिका मेल खाना चाहिए — और यह एक अर्ध-निजी test set पर होता है जिसे रटने से रोकने के लिए सार्वजनिक नहीं किया जाता।
- यह क्यों मायने रखता है
- यह उन पहेलियों पर केंद्रित है जो इंसानों के लिए आसान पर AI के लिए कठिन हैं, इसलिए यह रटे-रटाए ज्ञान के बजाय असली अमूर्तन और सामान्य तर्क का एक बारीकी से देखा जाने वाला मापदंड है।
हल किया गया उदाहरण
कार्य
ARC-AGI-2 ग्रिड पहेली: प्रशिक्षण जोड़ों से रूपांतरण का अनुमान लगाएँ, फिर परीक्षण इनपुट के लिए आउटपुट ग्रिड दें (अंक 0–9 रंग हैं, 0 = काली पृष्ठभूमि)। प्रशिक्षण 1: [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]। प्रशिक्षण 2: [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]। परीक्षण: [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
समाधान
[[0, 0, 0, 0],
[0, 0, 0, 0],
[5, 0, 2, 0],
[5, 0, 2, 0]]
व्याख्या
हर प्रशिक्षण जोड़ा एक ही नियम दिखाता है — 'गुरुत्वाकर्षण': हर रंगीन कोशिका अपने कॉलम की सबसे नीचे की खाली कोशिकाओं तक सीधे गिरती है, रंग और संख्या बनाए रखते हुए, जबकि पृष्ठभूमि (0) ऊपर चली जाती है। परीक्षण में, कॉलम 0 के दो 5 और कॉलम 2 के दो 2 सबसे नीचे की दो पंक्तियों में बैठ जाते हैं। ARC-AGI-2 सटीक ग्रिड मिलान से आकलन करता है — सही आयाम और हर कोशिका का मान — pass@2 (दो अनुमत प्रयास) के आधार पर स्कोर।