제37회 Hot Chips 컨퍼런스에서 OpenAI는 자체 맞춤형 추론 칩인 Jalapeño의 벤치마크 세부 사항을 발표하며, NVIDIA의 GB200 및 GB300 시스템 대비 와트당 더 우수한 성능을 주장했습니다. 이 칩은 최대 처리량에서 와트당 1.5–1.9배 더 많은 작업을 수행하고 종단 간 지연 시간을 1.7–3.6배 낮추며, 연내 OpenAI 인프라에 배포될 예정입니다.

  • Jalapeño는 700W 정격에도 불구하고 550W 이하를 유지하면서 매우 상호작용적인 워크로드에서 2.1–4.1배 더 높은 성능을 달성했습니다.
  • 이 아키텍처는 전통적인 처리량/지연 시간 트레이드오프를 줄여, 공격적인 prefill/decode 분리나 예측 디코딩 없이도 우수한 성능을 발휘합니다.
  • OpenAI는 GPT-Astra + Codex를 사용하여 저수준 커널을 최적화했으며, 2개월 만에 세 개의 오픈 가중치 모델을 높은 성능으로 가져와 인간이 작성한 코드 대비 1.5–1.8배의 속도 향상을 이루었습니다.
  • 기타 발표 사항으로는 Microsoft의 AutoSaddler 허스트 개선, NVIDIA DGX Spark 기반 Perplexity의 로컬 퍼스트 휴대용 컴퓨터, 그리고 에이전트 메모리 시스템에 대한 새로운 통찰력이 포함되었습니다.