llama.cpp プロジェクトはバージョン b11335 をリリースし、Volta GPU 用の CUDA 最適化が含まれています。この更新により、sm_70 アーキテクチャが汎用設定にフォールスルーするのではなく、既存の Turing MMVQ nwarps テーブルにルーティングされます。

  • Volta (sm_70) は K-quant batch-1 デコードに TURING 調整を使用し、ワープ数を 4 から 2 に変更します。
  • Qwen3.8-27B を搭載した Tesla V100 でのベンチマークは、ビット単位のパープレキシティが同一のまま、スループットが +3.17% (+1.091 t/s) 増加したことを示しています。
  • この変更は anyei/llamacpp-v100 フォークに由来し、デバイスとホストのテーブルセレクターの両方に適用されます。

この調整により、モデルの精度に影響を与えることなく、Volta ハードウェアでの推論速度が向上します。