O projeto llama.cpp lançou a compilação b11009, que aborda problemas críticos com o estado dividido e cálculos de granularidade para camadas de atenção QKV fundidas.

  • O código do modelo agora calcula corretamente os estados divididos para attn_qkv com base em n_head * n_embd_head_k, resolvendo problemas de compatibilidade com modelos gemma4 que usam a flag --fuse-qkv onde n_embd é 5376 mas Q é 8192.
  • Suporte para camadas de atenção completa fundidas foi adicionado para as arquiteturas qwen35 e qwen35moe.
  • Uma tag TODO [TAG_SPLIT_QGATE_QWEN] foi adicionada para rastrear trabalho adicional na divisão de QGate para modelos Qwen.

Este lançamento garante que configurações específicas do modelo, particularmente aquelas envolvendo operações QKV fundidas em gemma4 e qwen35, funcionem corretamente sem erros de cálculo de estado.