Проект llama.cpp выпустил версию b10707, включающую оптимизацию производительности обработки ключ-значительного (KV) кэша. Обновление изменяет функцию `for_each_token_in`, чтобы прекратить сканирование после того, как все последовательности в конкретной ячейке были просмотрены, вместо итерации по всем возможным максимальным последовательностям.
- Это изменение направлено на путь n-грамм через вызывающий объект `get_prev_tokens`.
- На RTX PRO 6000 с Qwen3.8-Flash-Next UD-Q4_K_XL скорость генерации увеличилась с 56,3 до 74,3 токенов в секунду при контексте 55k.
- При контексте 132k скорость генерации улучшилась с 33,6 до 50,9 токенов в секунду.
- Оптимизация масштабируется в зависимости от количества используемых ячеек, делая выигрыш более заметным при более длинных контекстах, не изменяя обработку промпта.
Релиз предоставляет бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.