llama.cppプロジェクトはビルドb10545をリリースし、MetalバックエンドのテンソルAPI行列乗算カーネルの重要なバグに対処しました。この更新は、K次元が32の倍数でないテンサーを処理する際の未定義動作や破損した結果を防ぎます。
- matmul2d演算は теперь Kに対して静的なタイルサイズではなくdynamic_extentを使用します。
- 各反復で、オペランドテンサービューは残りの有効なK範囲にクリップされます。
- この変更により、以前NaN値やデータ破損を引き起こしていた境界外読み取りが解消されました。
- アラインされていないKパスをテストし、修正を検証するためのテストケースが追加されました。
この修正により、Apple Siliconデバイス上のアラインされていない行列次元を持つモデルの数値安定性が確保され、推論中のサイレントエラーを防ぎます。