本文通过分析内存限制而非运行基准测试,计算出哪些开源大语言模型可以适配新的 Apple M5 系列 Mac(Mac mini、Mac Studio)。它基于 Q4_K_M GGUF 文件大小、KV 缓存需求以及相对于可用 GPU 内存的运行开销来确定容量。

  • 16 GB Mac mini M6 支持在 8K 上下文中运行 14 个模型,在 32K 上下文中运行 10 个,其中 Gemma 4 12B 为首选。
  • 24 GB Mac mini M5 Pro 可在 8K 上下文中容纳 16 个模型,在 32K 上下文中容纳 14 个,倾向于 gpt-oss 20B。
  • 36 GB Mac Studio M5 Max 可在 8K 上下文中容纳 25 个模型,在 32K 上下文中容纳 22 个,首选 Qwen3-Coder 30B-A3B。
  • 96 GB Mac Studio M5 Ultra 可容纳 31 个模型,与上下文长度无关,其中 Qwen3-Coder Next 是最大且舒适的适配选项。

分析强调,16 GB Mac mini 是一台受限于上下文窗口而非模型大小的 12B 级机器,而 Ultra 的大缓存使得上下文长度对适配不再重要。作者指出,这些数据并不表示生成速度,尽管不同模型之间的带宽差异显著。