OpenAI ने GPT-6 Astra के लिए तेज़ और सस्ते विकल्प के रूप में GPT-6 Sol और Luna पेश किए, जो कोडिंग, तथ्यात्मकता, कंप्यूटर उपयोग और पेशेवर कार्यों में उन्नति लाते हुए कम लागत वाले मॉडल प्रदान करते हैं।

  • Anthropic ने Claude Opus 5.5 जारी किया, जो अधिकांश कार्यओं में Claude Fable 5.1 के बराबर है लेकिन Opus 5 की तुलना में चलाने की लागत 40% कम है।
  • SWE-Bench Pro V2 ने 11 रिपॉजिटरीज़ से 642 कार्य जारी किए, जिसमें पिछले कार्य त्रुटियों को ठीक किया गया और मूल्यांकन प्रक्रियाओं को अनुकूलित किया गया।
  • Google ने RRSI पेश किया, एक विधि जो AI एजेंट के स्वयं को पुनरावृत्त रूप से सुधारने के तरीके को नियमित करती है ताकि बेंचमार्क ओवरफिटिंग कम की जा सके।

ये अपडेट उपयोगकर्ताओं को अधिक लागत-प्रभावी मॉडल विकल्प और AI प्रदर्शन का मूल्यांकन करने के लिए कठोर नए बेंचमार्क प्रदान करते हैं।