37वें Hot Chips सम्मेलन में, OpenAI ने अपने कस्टम इनफरेंस चिप, Jalapeño के लिए बेंचमार्क विवरण प्रस्तुत किए, यह दावा करते हुए कि इसकी प्रति वाट प्रदर्शन NVIDIA के GB200 और GB300 सिस्टम की तुलना में बेहतर है। चिप शीर्ष थ्रूपुट पर प्रति वाट 1.5–1.9× अधिक कार्य और 1.7–3.6× कम एंड-टू-एंड लेटेंसी प्रदान करती है, जिसका OpenAI की इंफ्रास्ट्रक्चर में डिप्लॉयमेंट वर्ष के अंत तक निर्धारित है।
- जलपेनो ने 700W रेटिंग के बावजूद 550W या उससे कम पर रहते हुए, अत्यधिक इंटरैक्टिव वर्कलोड के लिए 2.1–4.1× उच्च प्रदर्शन हासिल किया।
- आर्किटेक्चर पारंपरिक थ्रूपुट/लेटेंसी ट्रेडऑफ को कम करता है, जो एग्रेसिव प्रीफिल/डीकोड डिसेग्रिगेशन या स्पेकुलेटिव डिकोडिंग के बिना भी अच्छा प्रदर्शन करता है।
- OpenAI ने GPT-Astra + Codex का उपयोग लो-लेवल कर्नल को अनुकूलित करने के लिए किया, जिसने दो महीनों में तीन ओपन-वेट मॉडल को उच्च प्रदर्शन तक लाया और मानव द्वारा लिखे गए कोड की तुलना में 1.5–1.8× स्पीडअप दिया।
- अन्य घोषणाओं में Microsoft के AutoSaddler हार्नेस में सुधार, NVIDIA DGX Spark पर Perplexity का लोकल-फर्स्ट पोर्टेबल कंप्यूटर, और एजेंट मेमोरी सिस्टम पर नई अंतर्दृष्टि शामिल हैं।