llama.cpp b10994 リリースには、活性化値が f16 範囲を超えた場合に `mul_mm_id` 演算で NaN 出力が発生する問題を解決する Metal バックエンドの修正が含まれています。この欠陥により、以前は Apple Silicon デバイス上で 32 トークン以上のプリフィルステップ中に Mistral Small 4 などのモデルが完全に NaN の語彙を生成していました。
- 修正は src1 を 2 の累乗で再スケーリングして f16 の制限内に収め、f32 アキュムレータでのスケーリングを元に戻すことで、精度の損失なく正確な結果を保証します。
- M2 Max 上のパフォーマンスベンチマークでは、影響を受けたパスで中央値のオーバーヘッド +1.14% が示され、より大きなバッチサイズではわずかに高いコストが発生しました。
- このリリースでは、macOS(Apple Silicon および Intel)、iOS、Linux(CPU、CUDA、ROCm、OpenVINO、SYCL)、Android、および Windows 向けに、さまざまなハードウェア構成のバイナリが提供されています。