llama.cpp プロジェクトはビルド b10076 をリリースし、CUDA バックエンドの `get_rows` 操作を int4 コピーを使用してベクトル化することでパフォーマンス最適化を導入しました。この変更により、要素ごとのループから行不変の作業が持ち上げられ、連続した同種データに対してスレッドあたり 16 バイトをコピーするベクトル化パスが追加されました。

実装はコンパイル時およびランタイムでゲートされており、正確性を確保するために 16 バイトアラインメントと特定のストライド条件が必要です。occupancy gate は、小さな単一行の gather をスカラーパスに保持することで回帰を防ぎます。Strix Halo (gfx1151) では、この最適化により DeltaNet 再帰状態の gather レイテンシが 18.6us から 13.0us に短縮されました。

リリースには、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL、OpenCL バックエンド向けの macOS、Linux、Windows、Android、openEuler のバイナリが含まれています。