OpenAI, DeepMind, xAI, DeepSeek और Anthropic सहित लैबों से आगे की एआई तर्क प्रणालियों की समीक्षा दर्शाती है कि जबकि टेस्ट-टाइम कंप्यूट स्केलिंग सटीकता को बेहतर बनाती है, यह दक्षता को काफी कम कर देती है। विश्लेषण ARC-AGI-1 स्कोर के लिए एक पैरेटो फ्रंटियर की पहचान करता है, लेकिन अधिक चुनौतीपूर्ण ARC-AGI-2 बेंचमार्क पर पूर्ण विफलता का उल्लेख करता है, जो सभी प्रमुख मॉडलों में सामान्य सीमाओं को सुझाता है।
- आधुनिक तर्क प्रणालियाँ "सोचने के समय" बढ़ाने के लिए लंबे चलने वाले इनफरेंस, ज्ञान पुनर्संयोजन और समानांतर CoT सैंपलिंग पर निर्भर हैं।
- OpenAI का o3-medium/high उच्च लागत पर सबसे अधिक सटीकता प्रदान करता है, जबकि Google का Gemini 2.5 Flash सटीकता और लागत के बीच संतुलन प्रदान करता है।
- xAI का Grok 3 mini-low शुद्ध LLMs की तुलना में मामूली सटीकता सुधार कम संसाधन आवश्यकताओं के साथ प्रदान करता है।
- ARC-AGI-2 सभी परीक्षण की गई प्रणालियों द्वारा अभी तक हल नहीं किया गया है, जो दर्शाता है कि वर्तमान स्केलिंग रणनीतियाँ ब्रेकथ्रू AGI क्षमता के लिए अपर्याप्त हैं।
निष्कर्ष सुझाते हैं कि कोई एक सार्वभौमिक विजेता नहीं है और API असंगतताओं और अवलंबन बाधाओं के कारण एआई तर्क प्रणालियों की शुद्ध LLMs की तुलना में मजबूत उत्पाद-बाजार फिट नहीं है।