OpenAI publicó los detalles de las pruebas de rendimiento para su chip de inferencia personalizado, Jalapeño, afirmando una mayor eficiencia y menor latencia en comparación con los sistemas NVIDIA GB200/GB300. Simultáneamente, Perplexity lanzó la Computadora Portátil sobre hardware NVIDIA DGX Spark, permitiendo la orquestación completa de agentes de forma local sin dependencia de la nube.
- El Jalapeño de OpenAI entregó 1.5–1.9× más trabajo por vatio y una latencia extremo a extremo 1.7–3.6× menor que los sistemas NVIDIA en las pruebas.
- El chip está clasificado para 700W pero se mantuvo por debajo de 550W durante las pruebas, con un despliegue planeado para finales de año.
- La Computadora Portátil de Perplexity ejecuta el LLM orquestador, el LLM subagente y el arnés del agente localmente utilizando PPLX 27B o Qwen 3.8 27B.
- AutoSaddler, liderado por Microsoft, reportó ganancias de +9.0 en GAIA2 y +10.0 en Terminal-Bench 2.0 al tratar el arnés del agente como código.
- SWE Refactor Bench encontró solo una tasa de supervivencia del 5.4% para tareas de migración de repositorio completo en 520 ejecuciones.
Estos desarrollos destacan un cambio hacia hardware de inferencia especializado y arquitecturas de agentes locales que reducen la dependencia de la infraestructura en la nube.