El proyecto llama.cpp lanzó la compilación b11009, que aborda problemas críticos con el estado dividido y los cálculos de granularidad para las capas de atención QKV fusionadas.

  • El código del modelo ahora calcula correctamente los estados divididos para attn_qkv basándose en n_head * n_embd_head_k, resolviendo problemas de compatibilidad con modelos gemma4 que usan la bandera --fuse-qkv donde n_embd es 5376 pero Q es 8192.
  • Se ha añadido soporte para capas de atención completa fusionadas para las arquitecturas qwen35 y qwen35moe.
  • Se añadió una etiqueta TODO [TAG_SPLIT_QGATE_QWEN] para rastrear el trabajo adicional en la división de QGate para los modelos Qwen.

Este lanzamiento asegura que configuraciones específicas del modelo, particularmente aquellas que involucran operaciones QKV fusionadas en gemma4 y qwen35, funcionen correctamente sin errores de cálculo de estado.