Pada konferensi Hot Chips ke-37, OpenAI menyajikan detail benchmark untuk chip inferensi kustomnya, Jalapeño, dengan klaim kinerja per watt yang lebih unggul dibandingkan sistem GB200 dan GB300 dari NVIDIA. Chip ini menghasilkan 1,5–1,9× lebih banyak pekerjaan per watt pada throughput puncak dan latensi end-to-end 1,7–3,6× lebih rendah, dengan penjadwalan penerapan ke dalam infrastruktur OpenAI hingga akhir tahun.

  • Jalapeño mencapai kinerja 2,1–4,1× lebih tinggi untuk beban kerja yang sangat interaktif sambil tetap berada di atau di bawah 550W meskipun memiliki peringkat 700W.
  • Arsitektur ini mengurangi tradeoff throughput/latensi tradisional, berkinerja baik bahkan tanpa disagregasi prefill/decode agresif atau decoding spekulatif.
  • OpenAI menggunakan GPT-Astra + Codex untuk mengoptimalkan kernel tingkat rendah, membawa tiga model open-weight ke kinerja tinggi dalam dua bulan dengan percepatan 1,5–1,8× dibandingkan kode yang ditulis manusia.
  • Pengumuman lainnya mencakup peningkatan harness AutoSaddler oleh Microsoft, Portable Computer berbasis lokal dari Perplexity pada NVIDIA DGX Spark, dan wawasan baru tentang sistem memori agen.