llama.cpp 0.3.0 внедряет поддержку мультимодальной модели dots3-note с новым типом KV-кэша DSA-ISWA, а также поддержку многозадачного предсказания (MTP) для GLM-4.5-Air. В релизе также добавлена возможность разделения тензоров для DeepSeek 4 и исправлены проблемы с откатом множественных последовательностей.
- ggml обновлён до версии v0.22.0, добавлена поддержка разделения тензоров в мета-бэкенде и пер-оп Metal ядрах с параллельной компиляцией.
- mtmd получил поддержку зрения/аудио dots3-note, декодирование WebP через ffmpeg и алгоритм масштабирования, точный до Pillow.
- DeepSeek 4 получил режим разделения тензоров через флаг `-sm tensor` и исправления для отката при работе с несколькими последовательностями.
- Сервер добавил отладочную настройку `LLAMA_SERVER_SLOTS_N_DIFF`, а веб-интерфейс получил навигацию по вкладкам в чате.
Это обновление расширяет мультимодальные возможности llama.cpp и улучшает производительность и стабильность для конкретных архитектур моделей, таких как DeepSeek 4 и GLM-4.5-Air.