Проект llama.cpp выпустил сборку b10593, которая устраняет критические проблемы с архитектурой модели DeepseekV4. Обновление конкретно решает проблему сбоя отката, возникавшего при обработке множественных последовательностей.

  • Исправлена обработка отката DeepseekV4 для контекстов с несколькими последовательностями.
  • Исправлены общие процедуры загрузки моделей.
  • Сделаны ожидающие операции отката однократными для предотвращения повреждения состояния.
  • Обеспечено очистке кэша только для конкретного идентификатора последовательности при полной загрузке.
  • Добавлены проверки соотношения сжатия и сделана статической топология графа.

Этот выпуск повышает стабильность для пользователей, работающих с моделями DeepseekV4 с несколькими последовательностями. Он также предоставляет обновленные бинарные файлы для macOS, Linux, Windows, Android и iOS на различных аппаратных бэкендах, включая CPU, CUDA, ROCm и Vulkan.