En la 37ª conferencia Hot Chips, OpenAI presentó detalles de las pruebas de rendimiento para su chip de inferencia personalizado, Jalapeño, afirmando un rendimiento superior por vatio en comparación con los sistemas GB200 y GB300 de NVIDIA. El chip entrega entre 1,5 y 1,9 veces más trabajo por vatio en el pico de rendimiento y una latencia de extremo a extremo entre 1,7 y 3,6 veces menor, con la implementación en la infraestructura de OpenAI programada para finales de año.
- Jalapeño logró un rendimiento entre 2,1 y 4,1 veces mayor para cargas de trabajo altamente interactivas, manteniéndose en o por debajo de los 550W a pesar de una clasificación de 700W.
- La arquitectura reduce la compensación tradicional entre rendimiento y latencia, funcionando bien incluso sin una desagregación agresiva de prellenado/decodificación ni descodificación especulativa.
- OpenAI utilizó GPT-Astra + Codex para optimizar los núcleos de bajo nivel, llevando tres modelos de peso abierto a un alto rendimiento en dos meses con aceleraciones entre 1,5 y 1,8 veces superiores al código escrito por humanos.
- Otros anuncios incluyeron mejoras en el marco AutoSaddler de Microsoft, la computadora portátil local-first Portable Computer de Perplexity en NVIDIA DGX Spark, y nuevas perspectivas sobre los sistemas de memoria de agentes.