llama.cpp версии 0.4.0 вводит начальную архитектурную поддержку моделей Qwen3.8-Flash-Next и NVIDIA Nemotron-3-Puzzle-75B-A9B, а также обновление базовой библиотеки ggml до версии 0.23.0.
- Добавлено отложенное чтение тензоров по требованию и ограничения контекста сервера на слот.
- Обновлена библиотека ggml до версии 0.23.0 с поддержкой разреженного flash-внимания и транспорта Apple RDMA.
- Внедрены опции ввода видео, поиск истории n-грамм и лимиты оперативной памяти для квантователя.
- По умолчанию в сервере включена опция `preserve_reasoning`, улучшены вспомогательные средства мультимодальной токенизации.
Эти изменения расширяют совместимость моделей и предоставляют разработчикам более точный контроль над использованием памяти и распределением ресурсов сервера.