作者发布了 AiiStream Q3.6,这是一种开源技术,允许 Qwen3.6-35B-A3B 模型在仅配备 8 到 16 GB 内存的 Apple Silicon 设备上运行。通过将路由专家保留在 SSD 上并使用早期加载预测,该方法将 MLX 内存使用量降低至约 1.7 GB,同时保持与标准 mlx_lm 实现完全一致的字节级输出。
在配备 16 GB 内存的 M5 MacBook Air 上的关键性能指标包括:
- 在受控基准测试中达到 15.0 tok/s,比直接从 SSD 流式传输快 72.6%。
- 运行其他应用程序时约为 11.8 tok/s。
- 对于简短提示,首字生成时间(time-to-first-token)约为 2.3 秒。
该技术也设计用于在配备 8 GB 内存的 Mac 上工作,尽管该配置的性能数据仍基于当前版本发布的估算值。