OpenAI a publié les premiers résultats mesurés des performances de Jalapeño, sa puce d'inférence personnalisée, accompagnés d'un aperçu détaillé de sa stratégie de calcul « intelligence abondante » intégrée. L'entreprise explique comment elle combine des centres de données, des puces, des modèles et des logiciels pour améliorer l'efficacité et la viabilité économique de l'ensemble de son système.
- Jalapeño a offert un débit de pointe supérieur par kilowatt et une latence des tokens inférieure aux systèmes commerciaux sur le benchmark InferenceX avec GPT-OSS 120B.
- La puce a montré de solides performances sur DeepSeek R1 et Kimi K2, démontrant des gains au sein de différentes familles de modèles.
- OpenAI gère un portefeuille matériel diversifié incluant Microsoft, NVIDIA, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy et SoftBank.
- GPT-5.6 Sol avec raisonnement maximal a atteint un nouveau record sur l'Artificial Analysis Coding Agent Index tout en utilisant 54 % de tokens de sortie en moins qu'un modèle leader.
Cette approche vise à offrir un meilleur contrôle sur les coûts économiques du déploiement des modèles et à créer une voie crédible de première partie pour le silicium, garantissant les meilleures performances par dollar au fur et à mesure que la technologie évolue.