OpenAI ने अपने कस्टम इनफरेंस चिप, Jalapeño के लिए बेंचमार्क विवरण प्रकाशित किए, जिसमें NVIDIA GB200/GB300 सिस्टम की तुलना में बेहतर दक्षता और अग्रिम समय का दावा किया गया है। इसी समय, Perplexity ने NVIDIA DGX Spark हार्डवेयर पर पोर्टेबल कंप्यूटर लॉन्च किया, जो क्लाउड निर्भरता के बिना पूर्णतः स्थानीय एजेंट ऑर्केस्ट्रेशन को सक्षम बनाता है।

  • परीक्षणों में OpenAI के Jalapeño ने NVIDIA सिस्टम की तुलना में प्रति वाट 1.5–1.9× अधिक कार्य और 1.7–3.6× कम अंत-से-अंत अग्रिम समय प्रदान किया।
  • चिप का रेटिंग 700W है, लेकिन परीक्षण के दौरान यह 550W से नीचे रहा, और डिप्लॉयमेंट वर्ष के अंत तक की योजना है।
  • Perplexity का पोर्टेबल कंप्यूटर PPLX 27B या Qwen 3.8 27B का उपयोग करके ऑर्केस्ट्रेटर LLM, सबएजेंट LLM और एजेंट हार्नेस को स्थानीय रूप से चलाता है।
  • Microsoft नेतृत्व वाले AutoSaddler ने एजेंट हार्नेस को कोड के रूप में मानकर GAIA2 पर +9.0 और Terminal-Bench 2.0 पर +10.0 की वृद्धि दर्ज की।
  • SWE Refactor Bench ने 520 रनों में पूरे रिपॉजिटरी माइग्रेशन कार्यों के लिए केवल 5.4% जीवित रहने की दर पाई।

ये विकास विशेष इनफरेंस हार्डवेयर और स्थानीय-प्रथम एजेंट आर्किटेक्चर की ओर एक बदलाव को उजागर करते हैं जो क्लाउड इंफ्रास्ट्रक्चर पर निर्भरता को कम करते हैं।