本記事は、ベンチマークの実行ではなくメモリ制約を分析することで、新しいApple M5シリーズMac(Mac mini、Mac Studio)にどのオープンな大規模言語モデルが収まるかを計算している。使用可能なGPUメモリに対するQ4_K_M GGUFファイルサイズ、KVキャッシュの要件、ランタイムオーバーヘッドに基づいて容量を決定する。

  • 16 GB Mac mini M6は8Kコンテキストで14モデル、32Kで10モデルをサポートし、最上位候補はGemma 4 12Bである。
  • 24 GB Mac mini M5 Proは8Kで16モデル、32Kで14モデルが収まり、gpt-oss 20Bを推奨する。
  • 36 GB Mac Studio M5 Maxは8Kで25モデル、32Kで22モデルを収容し、Qwen3-Coder 30B-A3Bが優先オプションとなる。
  • 96 GB Mac Studio M5 Ultraはコンテキスト長に関係なく31モデルを保持でき、Qwen3-Coder Nextが最も快適に収まる最大モデルである。

分析により、16 GB Mac miniはモデルサイズではなくコンテキストウィンドウによって制限される12Bクラスのマシンであることが示されており、Ultraの大きなキャッシュは収容においてコンテキスト長を無関係にする。著者はこれらの数値が生成速度を示すものではないが、モデル間の帯域幅の違いは重要であると指摘している。