Проект llama.cpp выпустил версию b10704, которая обновляет бэкенд CUDA для использования оптимизированного пути mm_ids_helper для любого количества используемых экспертов (n_expert_used). Ранее этот быстрый путь ограничивался правилами делимости на размер варпа, заставляя большинство значений возвращаться к более медленной универсальной реализации.
- Оптимизация обобщает дополнение до следующей степени двойки, позволяя таким случаям, как n_expert_used = 10, использовать быстрый путь.
- Измерено на Qwen3.8-Flash-Next с 512 экспертами и 10 используемыми при контексте 55k на RTX PRO 6000: скорость обработки промпта увеличилась с 2334 до 2600 токенов в секунду.
- Производительность генерации токенов остается без изменений, так как оптимизация направлена на пакетную обработку токенов.
Это изменение улучшает задержку вывода для моделей, использующих архитектуру Mixture of Experts, за счет снижения накладных расходов при обработке промпта.