A OpenAI publicou detalhes dos benchmarks para seu chip de inferência personalizado, o Jalapeño, afirmando eficiência e latência superiores em comparação aos sistemas NVIDIA GB200/GB300. Simultaneamente, a Perplexity lançou o Computador Portátil no hardware NVIDIA DGX Spark, permitindo orquestração totalmente local de agentes sem dependência da nuvem.
- O Jalapeño da OpenAI entregou 1,5–1,9× mais trabalho por watt e latência ponta a ponta 1,7–3,6× menor do que os sistemas NVIDIA nos testes.
- O chip é classificado em 700W, mas permaneceu abaixo de 550W durante os testes, com implantação planejada para o final do ano.
- O Computador Portátil da Perplexity executa localmente o LLM orquestrador, o LLM subagente e a estrutura do agente usando PPLX 27B ou Qwen 3.8 27B.
- O AutoSaddler, liderado pela Microsoft, relatou ganhos de +9,0 no GAIA2 e +10,0 no Terminal-Bench 2.0 ao tratar a estrutura do agente como código.
- O SWE Refactor Bench encontrou apenas uma taxa de sobrevivência de 5,4% para tarefas de migração de repositório inteiro em 520 execuções.
Esses desenvolvimentos destacam uma mudança em direção a hardware de inferência especializado e arquiteturas de agentes locais que reduzem a dependência da infraestrutura de nuvem.