在第37届Hot Chips会议上,OpenAI展示了其定制推理芯片Jalapeño的基准测试细节,声称其每瓦性能优于NVIDIA的GB200和GB300系统。该芯片在峰值吞吐量下每瓦可完成1.5–1.9倍的工作量,端到端延迟降低1.7–3.6倍,并计划于年底前部署到OpenAI的基础设施中。
- Jalapeño在高度交互式工作负载中实现了2.1–4.1倍的更高性能,尽管额定功率为700W,但实际功耗保持在550W或以下。
- 该架构减少了传统的吞吐量/延迟权衡,即使在没有激进的前缀/解码分离或推测性解码的情况下也能表现良好。
- OpenAI使用GPT-Astra + Codex优化底层内核,在两个月内将三个开源模型提升至高性能水平,相比人工编写的代码实现了1.5–1.8倍的加速。
- 其他公告包括Microsoft的AutoSaddler工具链改进、Perplexity基于NVIDIA DGX Spark的首款本地优先便携式计算机,以及关于智能体记忆系统的新见解。