OpenAI发布了其定制推理芯片Jalapeño的基准测试详情,声称在效率和延迟方面优于NVIDIA GB200/GB300系统。同时,Perplexity在NVIDIA DGX Spark硬件上推出了Portable Computer,实现了完全本地的代理编排,无需依赖云服务。

  • 在测试中,OpenAI的Jalapeño每瓦特完成的工作量比NVIDIA系统多出1.5–1.9倍,端到端延迟低1.7–3.6倍。
  • 该芯片额定功率为700W,但在测试期间保持在550W以下,计划于年底前部署。
  • Perplexity的Portable Computer在本地运行编排器LLM、子代理LLM和代理框架,使用PPLX 27B或Qwen 3.8 27B。
  • 由微软主导的AutoSaddler报告称,通过将代理框架视为代码,在GAIA2上获得+9.0的提升,在Terminal-Bench 2.0上获得+10.0的提升。
  • SWE Refactor Bench发现,在520次运行中,整个仓库迁移任务的成功率仅为5.4%。

这些进展凸显了向专用推理硬件和本地优先代理架构的转变,从而减少对云基础设施的依赖。