Na 37ª conferência Hot Chips, a OpenAI apresentou detalhes de benchmark do seu chip de inferência personalizado, o Jalapeño, afirmando desempenho superior por watt em comparação aos sistemas GB200 e GB300 da NVIDIA. O chip entrega 1,5–1,9× mais trabalho por watt na taxa de transferência máxima e latência ponta a ponta 1,7–3,6× menor, com implantação prevista na infraestrutura da OpenAI até o final do ano.

  • Jalapeño alcançou desempenho 2,1–4,1× maior para cargas de trabalho altamente interativas, mantendo-se em ou abaixo de 550W apesar da classificação de 700W.
  • A arquitetura reduz a tradicional compensação entre taxa de transferência e latência, performando bem mesmo sem desagregação agressiva de prefill/decode ou decodificação especulativa.
  • A OpenAI utilizou GPT-Astra + Codex para otimizar kernels de baixo nível, levando três modelos de peso aberto a alto desempenho em dois meses com acelerações de 1,5–1,8× em relação ao código escrito por humanos.
  • Outros anúncios incluíram melhorias no harness AutoSaddler da Microsoft, o Computador Portátil local-first da Perplexity na NVIDIA DGX Spark e novos insights sobre sistemas de memória de agentes.