माइक्रोसॉफ्ट और हगिंग फेस ने थिंकिंगबॉक्स जारी किया, एक बेंचमार्क जो AI एजेंट्स का मूल्यांकन उनके टूल कॉल या अंतिम प्रतिक्रियाओं के बजाय अलग-अलग डेटाबेस स्टेट्स पर उनके प्रभाव को ग्रेड करके करता है। विभिन्न LLM मॉडल्स के खिलाफ 507 स्टेटफुल बिजनेस वर्कफ्लो को 20 बार चलाए जाने वाले अध्ययन में पाया गया कि जबकि कई एजेंट वैध टूल कॉल उत्पन्न करते हैं, वे अक्सर बैकएंड में गलत मान, अनचाहे अतिरिक्त प्रभाव या आवश्यक प्रभावों की कमी छोड़ देते हैं।

  • क्लॉड ओपस 5.5 कुल मिलाकर 67.16% pass@1 स्कोर के साथ अग्रणी है, लेकिन केवल तीन मॉडल अपनी एक-प्रयास स्कोर को 20 दोहरावों में बनाए रखते हैं: GPT-6 Astra (78%), क्लॉड ओपस 5.5 (71%), और क्लॉड ओपस 5 (71%)।
  • किमी-K3 सबसे व्यापक कार्य कवरेज को हल करता है (कम से कम एक बार 93.89%) लेकिन सबसे कम स्थिर में से एक है, केवल 13.41% कार्यों के लिए सभी 20 प्रयासों में सफल होता है।
  • GPT-5.6 Sol प्रति सफल कार्य प्रयास पर न्यूनतम लागत $0.127 प्रदान करता है, जबकि GPT-5.4 सबसे सस्ता विश्वसनीय विकल्प है जो सभी 20 प्रयासों पर प्रति पास किए गए कार्य के लिए $6.80 का खर्च लाता है।
  • लगभग पांच में से चार विफलताएं तर्क की कमी के बजाय टूल हैंडलिंग समस्याओं जैसे कि त्रुटियों या खाली खोजों से पुनर्प्राप्त करने में विफलता को दी जाती है।

लेखकों का तर्क है कि pass@1 स्कोर अकेले डिप्लॉयमेंट विश्वसनीयता के लिए पर्याप्त नहीं हैं और वे उत्पादन में परिवर्तनों को कमिट करने से पहले टर्मिनल स्टेट की जांच करने के रूप में 20/20 स्थिरता दर को एक डिज़ाइन इनपुट मानने की सलाह देते हैं।