OpenAI a publié les détails des benchmarks pour sa puce d'inférence personnalisée, Jalapeño, affirmant une efficacité et une latence supérieures par rapport aux systèmes NVIDIA GB200/GB300. Parallèlement, Perplexity a lancé le Portable Computer sur du matériel NVIDIA DGX Spark, permettant l'orchestration d'agents entièrement locale sans dépendance au cloud.

  • Jalapeño d'OpenAI a fourni 1,5 à 1,9 fois plus de travail par watt et une latence de bout en bout inférieure de 1,7 à 3,6 fois que les systèmes NVIDIA lors des tests.
  • La puce est évaluée à 700W mais est restée en dessous de 550W pendant les tests, avec un déploiement prévu d'ici la fin de l'année.
  • Le Portable Computer de Perplexity exécute localement le LLM orchestrateur, le LLM sous-agent et le harnais d'agent en utilisant PPLX 27B ou Qwen 3.8 27B.
  • AutoSaddler dirigé par Microsoft a signalé des gains de +9,0 sur GAIA2 et +10,0 sur Terminal-Bench 2.0 en traitant le harnais d'agent comme du code.
  • SWE Refactor Bench n'a trouvé qu'un taux de survie de 5,4 % pour les tâches de migration de dépôt entier sur 520 exécutions.

Ces développements mettent en évidence un changement vers du matériel d'inférence spécialisé et des architectures d'agents locales en premier lieu qui réduisent la dépendance à l'infrastructure cloud.