Проект llama.cpp выпустил версию b10355, добавившую поддержку сэмплирования бэкенда с множественным выводом. Это обновление позволяет комбинировать сэмплирование бэкенда со спекуляцией токенов и добавляет числовой параметр контекста для объявления максимального количества выводов на последовательность.
- Включить сэмплирование бэкенда со спекуляцией токенов
- Ограничить сумму маски перед преобразованием её в индекс выборки
- Добавить числовой параметр контекста, объявляющий максимальное количество выводов для одной последовательности
- Исправить несоответствия между сэмплированием CPU и бэкенда, а также выровнять распределение (dist) между CPU и GPU
- Упростить изменения и исправить тесты на Vulkan
Релиз предоставляет бинарные файлы для macOS, iOS, Linux, Android, Windows и openEuler для различных аппаратных бэкендов, включая CPU, CUDA, ROCm, OpenVINO, SYCL, HIP и Vulkan.