OpenAI는 자체 맞춤형 추론 칩인 할라페뇨의 첫 측정된 성능 결과와 통합된 "풍부한 지능" 컴퓨팅 전략에 대한 상세 개요를 함께 공개했습니다. 이 회사는 데이터 센터, 칩, 모델, 소프트웨어를 결합하여 전체 시스템 전반의 효율성과 경제성을 어떻게 개선하는지 설명합니다.

  • 할라페뇨는 InferenceX 벤치마크에서 GPT-OSS 120B를 사용하여 상용 시스템보다 킬로와트당 더 높은 최대 처리량과 낮은 토큰 지연 시간을 달성했습니다.
  • 이 칩은 DeepSeek R1과 Kimi K2에서 강력한 성능을 발휘하여 다양한 모델 계열 전반에 걸쳐 개선을 보였습니다.
  • OpenAI는 Microsoft, NVIDIA, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy, SoftBank를 포함한 다양한 하드웨어 포트폴리오를 관리합니다.
  • 최대 추론을 사용한 GPT-5.6 Sol은 Artificial Analysis Coding Agent Index에서 새로운 최고치를 기록하며 선도적인 모델보다 출력 토큰을 54% 더 적게 사용했습니다.

이러한 접근 방식은 모델 서빙 경제성에 대한 더 큰 통제력을 제공하고 실리콘에 대한 신뢰할 수 있는 퍼스트파티 경로를 마련하여 기술이 발전함에 따라 달러당 가장 강력한 성능을 보장하는 것을 목표로 합니다.