Проект llama.cpp выпустил сборку b10737, которая устраняет критические ошибки в поддержке архитектуры qwen4exp. Обновление решает проблемы с сохранением последовательного состояния и предотвращает сбои CUDA при загрузке модели.

  • Исправляет коллапс kvu NaN и восстанавливает данные кэша индексатора ext.x/ext.y во время циклов сохранения/восстановления для моделей qwen4exp.
  • Корректно выводит количество строк per_layer_token_embd и отклоняет разыменование нулевого указателя в слоях рекуррентного кэша PLE.
  • Отключает флаг -sm tensor для qwen4exp, который ранее вызывал NaN логиты и сбои на реальных устройствах.
  • Переименовывает seq_set в seq_get_all для разрешения конфликтов перегрузки функций и добавляет тесты, проверяющие целостность состояния.

Эти изменения гарантируют, что модели qwen4exp могут быть загружены и сохранены без повреждения данных или ошибок времени выполнения, особенно при использовании содержимого 2D mrope или слоев PLE.