Проект llama.cpp выпустил сборку b10730, включающую оптимизации для архитектуры модели Qwen4exp. Основное изменение заключается в суммировании голов индексатора по срезам вместо использования операции транспонирования и sum_rows, что снижает накладные расходы на копирование памяти.
- Скорость обработки промптов увеличилась с 2170 до 2366 токенов в секунду на RTX PRO 6000 с Qwen3.8-Flash-Next UD-Q4_K_XL.
- Оптимизация устраняет избыточные требования к непрерывности тензоров для запроса индексатора, так как rope возвращает вновь выделенный непрерывный тензор.
- Скорость генерации остаётся без изменений, но выигрыш при обработке промптов масштабируется в зависимости от длины контекста и размера ubatch.
- Жадный вывод не изменился токенов к токену по сравнению с предыдущими версиями.
Это обновление повышает эффективность задач вывода с длинным контекстом, включающих модели Qwen4exp, за счёт снижения вычислительных потерь на этапе обработки промпта.