Проект llama.cpp выпустил сборку b10593, которая устраняет критические проблемы с архитектурой модели DeepseekV4. Обновление конкретно решает проблему сбоя отката, возникавшего при обработке множественных последовательностей.
- Исправлена обработка отката DeepseekV4 для контекстов с несколькими последовательностями.
- Исправлены общие процедуры загрузки моделей.
- Сделаны ожидающие операции отката однократными для предотвращения повреждения состояния.
- Обеспечено очистке кэша только для конкретного идентификатора последовательности при полной загрузке.
- Добавлены проверки соотношения сжатия и сделана статической топология графа.
Этот выпуск повышает стабильность для пользователей, работающих с моделями DeepseekV4 с несколькими последовательностями. Он также предоставляет обновленные бинарные файлы для macOS, Linux, Windows, Android и iOS на различных аппаратных бэкендах, включая CPU, CUDA, ROCm и Vulkan.