OpenAI ने o1-preview और o1-mini मॉडल जारी किए, जिन्हें अंतिम उत्तर देने से पहले तर्क टोकन उत्पन्न और परिष्कृत करके तर्क का अनुकरण करने के लिए प्रशिक्षित किया गया है। ARC-AGI सार्वजनिक मूल्यांकन डेटासेट पर परीक्षण दर्शाते हैं कि दोनों o1 संस्करण सटीकता में GPT-4o से बेहतर प्रदर्शन करते हैं।

  • o1-preview की सटीकता Anthropic के Claude 3.5 Sonnet के तुलनीय है लेकिन कार्यों को पूरा करने में लगभग 10 गुना अधिक समय लेता है।
  • 400 सार्वजनिक ARC-AGI कार्यों को हल करने में o1 को 70 घंटे लगे, जबकि GPT-4o और Claude 3.5 Sonnet को केवल 30 मिनट लगे।
  • मॉडल प्रशिक्षण और इनफरेंस दोनों समय पर लागू चेन-ऑफ़-थॉट पैराडाइम का उपयोग करते हैं, रणनीतियों को परिष्कृत करने के लिए पुनर्बल सीखने का लाभ उठाते हैं।
  • प्रदर्शन टेस्ट-टाइम कंप्यूट के साथ स्केल होता है, जिसमें सटीकता और उपयोग किए गए तर्क टोकन की मात्रा के बीच लघुगणकीय-रैखिक संबंध दिखाई देता है।

परिणाम यह उजागर करते हैं कि हालांकि बढ़ा हुआ टेस्ट-टाइम कंप्यूट सटीकता को बेहतर बनाता है, व्यावहारिक अनुप्रयोग और बेंचमार्किंग के लिए दक्षता एक महत्वपूर्ण कारक बनी रहती है।