OpenAI a publié les premiers résultats de performance de Jalapeño, sa première puce d'inférence personnalisée, démontrant des gains significatifs en vitesse et en efficacité énergétique par rapport aux systèmes commerciaux existants. L'entreprise indique que la nouvelle architecture permet un débit plus élevé et une latence plus faible simultanément, répondant à un compromis courant dans le matériel actuel.

  • Jalapeño a fourni de 1,5 à 1,9 fois plus de travail d'IA par watt à un débit maximal que les systèmes de comparaison.
  • La latence de bout en bout a été réduite de 1,7 à 3,6 fois sur les modèles testés, notamment GPT-OSS 120B, DeepSeek R1 et Kimi K2.5 1T.
  • Pour des charges de travail hautement interactives, la puce a offert des performances 2,1 à 4,1 fois supérieures.
  • Le système a atteint une consommation d'énergie soutenue inférieure ou égale à 550 watts malgré une puissance nominale de 700 watts.

Ces améliorations visent à rendre l'IA de plus en plus capable plus abordable et largement disponible en réduisant le coût de la livraison de résultats réussis tout en soutenant une itération plus rapide pour les charges de travail agentic.