Проект llama.cpp выпустил версию 0.1.2, которая включает синхронизацию с ggml (обновлена до 0.20.2) и несколько обновлений компонентов сервера и пользовательского интерфейса.
- CUDA: MMVQ nwarps=8 для bs=1 для плотных моделей на DGX Spark.
- mtmd: использовать sha256 для хеширования ввода.
- vocab: поддержка целочисленных оценок токенизатора.
- mtmd: пропускать миниатюры для нетайловых изображений LFM2.
- server: сохранять обработанные фрагменты mtmd в качестве заполнителя.
- ui: обеспечить алфавитный порядок членов перечисления и переименовать встроенные инструменты.
Это обновление также включает очистку сборки для xcframework + cmake и обновление процессов CI для генерации предварительных версий.