लेखक ने ARC-AGI तर्क बेंचमार्क के सार्वजनिक टेस्ट सेट पर 50% की नई स्टेट-ऑफ़-द-आर्ट सटीकता प्राप्त की, प्रत्येक समस्या के लिए हज़ारों Python कार्यान्वयनों को उत्पन्न और मूल्यांकन करने के लिए GPT-4o का लाभ उठाकर।

  • विधि चरण-दर-चरण तर्क के साथ फ़ी-शॉट प्रॉम्प्ट्स का उपयोग करके प्रति समस्या लगभग 8,000 Python कार्यक्रम उत्पन्न करती है।
  • प्रदान किए गए उदाहरणों के सापेक्ष उनकी सटीकता के आधार पर कार्यक्रमों का चयन किया जाता है, ग्रिड आकार परिवर्तनों के लिए एक एन्सेम्बल दृष्टिकोण के साथ।
  • पुनरीक्षण चरण सबसे वादा करने वाले 12 कार्यान्वयनों को ठीक करने का प्रयास करता है, उन्हें उनका वास्तविक आउटपुट दिखाकर और सुधार मांगकर।
  • पूर्व स्टेट-ऑफ़-द-आर्ट 34% सटीकता थी, जबकि मानव आसान ट्रेन वितरण पर 85% हासिल करते हैं।

यह परिणाम दर्शाता है कि वर्तमान बड़े भाषा मॉडल व्यापक सैंपलिंग और सत्यापन के माध्यम से जटिल तर्क कार्यों में अच्छी तरह प्रदर्शन कर सकते हैं, इस दावे को चुनौती देते हुए कि वे इनफरेंस समय पर सीखने की क्षमताओं से वंचित हैं।