Qwen टीम ने Qwen3.8 27B मॉडल जारी किया है, जो Artificial Analysis एजेंटिक इंडेक्स पर Opus 5 Medium से बेहतर प्रदर्शन करता है।
- Qwen3.8 27B ने Artificial Analysis एजेंटिक इंडेक्स बेंचमार्क पर Opus 5 Medium की तुलना में उच्च स्कोर हासिल किया है।
Qwen टीम ने Qwen3.8 27B मॉडल जारी किया है, जो Artificial Analysis एजेंटिक इंडेक्स पर Opus 5 Medium से बेहतर प्रदर्शन करता है।
क्लाउड ओपस 5.5 लॉन्च हो चुका है, जिसने सिंपलबेंच में 88.4% स्कोर के साथ अग्रता प्राप्त की है और उच्च-गुणवत्ता वाले एक्सप्लेनर वीडियो बनाने की अपनी क्षमता के लिए समुदाय में महत्वपूर्ण ध्यान आकर्षित किया है।
शोधकर्ताओं ने SkillGym पेश किया, एक फ्रेमवर्क जो मानव-लेखित एजेंट कौशल को बड़े भाषा मॉडल एजेंट्स के लिए निष्पादन योग्य और सत्यापन योग्य प्रशिक्षण वातावरणों में परिवर्तित करता है। सिस्टम एक skill-to-task पाइपलाइन का उपयोग करके ठोस कार्यों को तैनात करता है और कोड-आधारित चेकरों के साथ परिणामों की पुष्टि करता है।
TrueForge, एक ओपन-सोर्स मॉडल-निरपेक्ष एजेंट हार्नेस के डेवलपर्स ने DevRev Enterprise-Bench का उपयोग करके इसका तुलना Claude Managed Agents के साथ किया। तुलना से पता चला कि TrueForge प्रबंधित प्लेटफ़ॉर्मों की तरह ही सॉल्व दर को बनाए रख सकता है, जबकि संसाधन खपत में काफी कमी लाता है।
Anthropic ने कोडिंग और ज्ञान कार्य के लिए अपने नए फ्लैगशिप मॉडल के रूप में Claude Fable 5.1 और Claude Mythos 5.1 जारी किए हैं, उन्हें स्वतंत्र, बहु-चरण कार्यों के लिए दुनिया के सबसे उन्नत मॉडल के रूप में स्थापित करते हुए।
ओरोबोरस एक स्व-विकासित एजेंट फ्रेमवर्क है जहाँ टूल्स, प्रॉम्प्ट्स और कोर इम्प्लीमेंटेशन समीक्षित कमिट्स के माध्यम से सुधरते हैं जो बाद के काम के लिए रनटाइम बन जाते हैं। यह उपयोग के दौरान पाए गए बग और अक्षमताओं द्वारा ट्रिगर किए गए पुनरावर्ती मुक्त विकास या अनुभव-संचालित कोर विकास के माध्यम से संचालित होता है।
हम ट्रैफ़िक मापने और साइट को बेहतर बनाने के लिए कुकीज़ का उपयोग करते हैं। आप एनालिटिक्स कुकीज़ स्वीकार या अस्वीकार कर सकते हैं। गोपनीयता नीति