Проект llama.cpp выпустил версию b10199, внедряя новые возможности в свой серверный компонент. Основное обновление позволяет серверу поддерживать встраивания для генерации следующего токена, конкретно добавляя поддержку встраиваний выбранных токенов.
- Сервер теперь поддерживает генерацию встраиваний для выбранных токенов, чтобы облегчить рабочие процессы предсказания следующего токена.
- Была исправлена ошибка в деструкторе ~server_batch().
- Сборки macOS Apple Silicon (arm64) с KleidiAI отключены в этом релизе.
- Предварительно собранные бинарные файлы доступны для Linux, Windows, Android и macOS для CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL и OpenCL бэкендов.
Это обновление позволяет пользователям, использующим сервер llama.cpp, получать доступ к встраиваниям токенов непосредственно во время генерации, что полезно для приложений, требующих векторных представлений выходных токенов.