На 37-й конференции Hot Chips компания OpenAI представила данные бенчмарков для своего собственного чипа вывода Jalapeño, заявив о превосходной производительности на ватт по сравнению с системами NVIDIA GB200 и GB300. Чип обеспечивает выполнение на 1.5–1.9× больше работы на ватт при пиковой пропускной способности и снижает сквозную задержку на 1.7–3.6×; его внедрение в инфраструктуру OpenAI запланировано до конца года.

  • Jalapeño показал производительность на 2.1–4.1× выше для высокоинтерактивных рабочих нагрузок, оставаясь при мощности 550 Вт или ниже, несмотря на номинальную мощность 700 Вт.
  • Архитектура снижает традиционный компромисс между пропускной способностью и задержкой, демонстрируя хорошие результаты даже без агрессивного разделения префилла/декода или спекулятивного декодирования.
  • OpenAI использовала GPT-Astra + Codex для оптимизации низкоуровневых ядер, выведя три модели с открытыми весами на высокий уровень производительности за два месяца, обеспечив ускорение в 1.5–1.8× по сравнению с кодом, написанным вручную.
  • Среди других объявлений — улучшения фреймворка AutoSaddler от Microsoft, локально-ориентированный портативный компьютер Perplexity на базе NVIDIA DGX Spark и новые данные о системах памяти агентов.