Проект llama.cpp выпустил сборку b11009, которая устраняет критические проблемы с разделением состояния и вычислениями гранулярности для слитных слоев внимания QKV.

  • Код модели теперь корректно вычисляет состояния разделения для attn_qkv на основе n_head * n_embd_head_k, решая проблемы совместимости с моделями gemma4, использующими флаг --fuse-qkv, где n_embd равен 5376, а Q — 8192.
  • Добавлена поддержка слитных слоев полного внимания для архитектур qwen35 и qwen35moe.
  • Добавлен тег TODO [TAG_SPLIT_QGATE_QWEN] для отслеживания дальнейшей работы по разделению QGate для моделей Qwen.

Этот релиз гарантирует, что конкретные конфигурации моделей, особенно те, которые включают слитные операции QKV в gemma4 и qwen35, работают корректно без ошибок вычисления состояния.