Проект llama.cpp выпустил версию b10718, которая включает значительное обновление бэкенда CUDA. Наиболее заметным изменением является расширение слияния Mixture of Experts (MOE) для поддержки спекулятивного декодирования (specdec), что устраняет предыдущие ограничения, при которых слияние MOE glu и topk-router было ограничено обработкой только одного токена за раз.

  • CUDA: Расширено слияние MOE на specdec, снято ограничение на один токен для предыдущих слияний MOE glu и topk-router.
  • Добавлена поддержка случая SWIGLU_CLAMP в реализации многотокенного слияния MOE.
  • Учтены комментарии к ревью из pull request #27621.

Это обновление улучшает производительность моделей, использующих спекулятивное декодирование, за счет более эффективных слитых операций на GPU NVIDIA.