Lors de la 37e conférence Hot Chips, OpenAI a présenté les détails des benchmarks pour sa puce d'inférence personnalisée, Jalapeño, affirmant une performance par watt supérieure par rapport aux systèmes GB200 et GB300 de NVIDIA. La puce offre 1,5 à 1,9 fois plus de travail par watt au débit maximal et une latence de bout en bout réduite de 1,7 à 3,6 fois, avec un déploiement dans l'infrastructure d'OpenAI prévu pour la fin de l'année.
- Jalapeño a atteint des performances 2,1 à 4,1 fois supérieures pour les charges de travail hautement interactives tout en restant à ou en dessous de 550W malgré une puissance nominale de 700W.
- L'architecture réduit le compromis traditionnel entre débit et latence, offrant de bonnes performances même sans désagrégation agressive du préremplissage/décodage ni décodage spéculatif.
- OpenAI a utilisé GPT-Astra + Codex pour optimiser les noyaux de bas niveau, portant trois modèles à poids ouverts à des performances élevées en deux mois avec des accélérations de 1,5 à 1,8 fois par rapport au code écrit par des humains.
- D'autres annonces comprenaient les améliorations du harnais AutoSaddler de Microsoft, l'ordinateur portable Portable Computer de Perplexity axé sur le local sur NVIDIA DGX Spark, et de nouvelles perspectives sur les systèmes de mémoire d'agents.