Проект llama.cpp выпустил версию 0.1.2, которая включает синхронизацию с ggml (обновлена до 0.20.2) и несколько обновлений компонентов сервера и пользовательского интерфейса.

  • CUDA: MMVQ nwarps=8 для bs=1 для плотных моделей на DGX Spark.
  • mtmd: использовать sha256 для хеширования ввода.
  • vocab: поддержка целочисленных оценок токенизатора.
  • mtmd: пропускать миниатюры для нетайловых изображений LFM2.
  • server: сохранять обработанные фрагменты mtmd в качестве заполнителя.
  • ui: обеспечить алфавитный порядок членов перечисления и переименовать встроенные инструменты.

Это обновление также включает очистку сборки для xcframework + cmake и обновление процессов CI для генерации предварительных версий.