Проект llama.cpp добавил начальную поддержку архитектуры модели GLM-5.3-Flash (GLM5-Next), включая миграцию на гибридную индексацию памяти и ранние возможности Multi-Token Prediction (MTP).
- Добавлена начальная поддержка MTP, хотя она была исключена из первоначального pull request для обеспечения сфокусированного ревью.
- Раскладка k-pool теперь сохраняется между ubatch'ами для предотвращения устаревания после редактирования последовательностей и общих операций teardown.
- Контрольные точки рекуррентного отката корректно записываются для состояния conv и состояния delta net.
- Исправлена ошибка в stride потока build_attn_mha для неконтейгуарных запросов, обеспечивающая корректный префилл с несколькими потоками для GLM5-Next.
- Фильтры защиты квантования были очищены от дублирующихся записей.
Эти изменения обеспечивают стабильный инференс и правильное управление состоянием для моделей GLM5-Next на различных аппаратных бэкендах, включая CUDA, ROCm и CPU.