llama.cpp версии 0.4.0 вводит начальную архитектурную поддержку моделей Qwen3.8-Flash-Next и NVIDIA Nemotron-3-Puzzle-75B-A9B, а также обновление базовой библиотеки ggml до версии 0.23.0.

  • Добавлено отложенное чтение тензоров по требованию и ограничения контекста сервера на слот.
  • Обновлена библиотека ggml до версии 0.23.0 с поддержкой разреженного flash-внимания и транспорта Apple RDMA.
  • Внедрены опции ввода видео, поиск истории n-грамм и лимиты оперативной памяти для квантователя.
  • По умолчанию в сервере включена опция `preserve_reasoning`, улучшены вспомогательные средства мультимодальной токенизации.

Эти изменения расширяют совместимость моделей и предоставляют разработчикам более точный контроль над использованием памяти и распределением ресурсов сервера.