Проект llama.cpp выпустил версию b10199, внедряя новые возможности в свой серверный компонент. Основное обновление позволяет серверу поддерживать встраивания для генерации следующего токена, конкретно добавляя поддержку встраиваний выбранных токенов.

  • Сервер теперь поддерживает генерацию встраиваний для выбранных токенов, чтобы облегчить рабочие процессы предсказания следующего токена.
  • Была исправлена ошибка в деструкторе ~server_batch().
  • Сборки macOS Apple Silicon (arm64) с KleidiAI отключены в этом релизе.
  • Предварительно собранные бинарные файлы доступны для Linux, Windows, Android и macOS для CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL и OpenCL бэкендов.

Это обновление позволяет пользователям, использующим сервер llama.cpp, получать доступ к встраиваниям токенов непосредственно во время генерации, что полезно для приложений, требующих векторных представлений выходных токенов.