Проект llama.cpp добавил поддержку архитектуры модели Qwen3.8-Flash-Next (qwen4exp), реализовав её специфические компоненты, включая гиперсвязи, управляемые дельта-сети, Смешивание экспертов (MoE) и вложения PLE n-gram хэшей.

  • Добавлена инфраструктура GGUF для qwen4_exp, включая тензоры для гиперсвязей низкого ранга и вложений PLE.
  • Реализован граф декодирования с остаточными потоками гиперсвязей и блоками MoE, проверенный против vLLM с высоким совпадением top-1.
  • Введено хэширование на стороне хоста для вложений PLE n-gram с использованием 64-битных целых чисел из-за больших значений множителей.
  • Добавлена опциональная поддержка кэша ключей индексатора в llama_memory_hybrid для включения разреженного внимания QSA для гибридных моделей.

Это дополнение позволяет загружать и выполнять вывод моделей Qwen3.8-Flash-Next внутри llama.cpp, расширяя покрытие его архитектуры.