llama.cpp プロジェクトはビルド b11227 をリリースし、マルチモーダル処理中の `causal_attn` フラグの処理を対象としたパフォーマンス最適化を含んでいます。
- スケジューラーは `causal_attn` の切り替え時にメモリを再確保しなくなり、以前 Gemma などのモデルで視覚入力を遅らせていた高コストなパスが解消されました。
- qwen4exp インデクサのバイアス形状は `causal_attn` に依存しなくなり、`GGML_SCHED_NO_REALLOC` の制約下でのバッファ再割り当て失敗を防ぎます。
- gemma-4-26B-A4B を使用した llama-server のベンチマークでは、RTX 4090 で 24 枚の画像に対して 7.61 倍の高速化、H200 で大きなコンテキスト設定時に最大 3.40 倍の高速化などの顕著なレイテンシ削減が示されました。
これらの変更により、生成される出力やグラフ再構築の動作を変更せずに、複数画像および動画の入力に対する推論速度が向上します。