ARC Prize Foundation ने ARC-AGI तर्क बेंचमार्क पर OpenAI के o3 और o4-mini मॉडल्स का अपना पहला सार्वजनिक विश्लेषण प्रकाशित किया है। मूल्यांकन से पता चलता है कि हालांकि ये फ्रंटियर मॉडल्स महत्वपूर्ण प्रगति दिखाते हैं, लेकिन वे अभी तक कठिन ARC-AGI-2 सेट को हल नहीं कर पाए हैं।

  • o3-medium ने ARC-AGI-1 Semi Private Eval सेट पर 53% हासिल किया, जबकि o4-mini-medium उच्च दक्षता के साथ 41% तक पहुंचा।
  • दोनों o3 और o4-mini ने अधिक चुनौतीपूर्ण ARC-AGI-2 बेंचमार्क पर 3% से कम स्कोर किया।
  • उच्च तर्क सेटिंग्स के कारण टाइमआउट या गायब आउटपुट की वजह से अधूरी कवरेज हुई, जिससे ये परिणाम लीडरबोर्ड रिपोर्टिंग के लिए उपयुक्त नहीं रहे।
  • उत्पादन o3 मॉडल पहले o3-preview से भिन्न है क्योंकि इसमें विज़ुअल इनपुट को एकीकृत किया गया है और अलग प्रशिक्षण डेटा प्रतिबंधों का उपयोग किया गया है।

इन निष्कर्षों से स्पष्ट होता है कि ARC-AGI-1 वर्तमान मॉडल क्षमताओं को मापने के लिए एक संवेदनशील उपकरण बना हुआ है, जबकि ARC-AGI-2 मानवीय और AI तर्क के बीच की खाई को पाटने वाले भविष्य के मॉडल्स के लिए अगली पीढ़ी का बेंचमार्क के रूप में कार्य करता है।