OpenAI ने अपने नए o3 तर्क भाषा मॉडल का प्रीव्यू दिया है, जो जनवरी 2025 के अंत में सार्वजनिक रिलीज से पहले AI क्षमताओं में तेज़ प्रगति की ओर संकेत करता है। इस घोषणा ने Gemini 1.5 Pro और Claude 3.5 Sonnet जैसे पिछले शीर्ष मॉडलों के मुकाबले महत्वपूर्ण प्रदर्शन में वृद्धि को उजागर किया है।
- o3 वह पहला मॉडल है जिसने ARC AGI पुरस्कार सार्वजनिक सेट पर 85% की सीमा को पार कर लिया, जो मानव जैसी तरल बुद्धिमत्ता को मापने के लिए डिज़ाइन किया गया एक बेंचमार्क है।
- यह Frontier Math बेंचमार्क पर 25% स्कोर हासिल करता है, जो पिछले शीर्ष स्कोर 2% से काफी अधिक वृद्धि है।
- मॉडल Codeforces पर अंतर्राष्ट्रीय ग्रैंडमास्टर स्तर का प्रदर्शन करता है और SWE-Bench-Verified पर 71.7% स्कोर के साथ एक नया शीर्ष स्कोर स्थापित करता है।
- OpenAI ने विचारशील संरेखण (deliberative alignment) पर शोध भी जारी किया, जिसमें दिखाया गया है कि o1-श्रेणी के मॉडल सुरक्षा और संरेखण अध्ययनों को कैसे बढ़ा सकते हैं।
ये परिणाम सुझाव देते हैं कि तर्क मॉडल गणित और कोडिंग जैसे सत्यापन योग्य क्षेत्रों से परे मूल्य प्रदान करना शुरू कर रहे हैं, जो संभावित रूप से AI शोध पारिस्थितिकी तंत्र में प्रगति को तेज़ कर सकते हैं।