llama.cpp プロジェクトはビルド b11009 をリリースし、融合 QKV アテンションレイヤーの分割状態と粒度計算に関する重要な問題を解決しました。
- モデルコードは now n_head * n_embd_head_k に基づいて attn_qkv の分割状態を正しく計算し、n_embd が 5376 で Q が 8192 である --fuse-qkv フラグを使用する gemma4 モデルとの互換性問題を解決しました。
- qwen35 および qwen35moe アーキテクチャに対して融合フルアテンションレイヤーのサポートが追加されました。
- Qwen モデルの QGate 分割に関するさらなる作業を追跡するために、TODO タグ [TAG_SPLIT_QGATE_QWEN] が追加されました。
このリリースにより、gemma4 および qwen35 の融合 QKV 操作に関連する特定のモデル構成が、状態計算エラーなしで正しく機能することが保証されます。