Проект llama.cpp выпустил сборку b10584, устраняющую критическую проблему, при которой размер контекста черновика не совпадал с целевым контекстом, что приводило к сбоям запросов сервера с ошибками 500.

  • Сервер теперь гарантирует, что контекст черновика соответствует размеру целевого контекста, предотвращая сбои декодирования при заполнении слотов за пределы предыдущих ограничений.
  • Резервирование памяти для модели черновика измеряется по максимальному контексту, который может принять целевая модель, позволяя контекстам, разделяющим ячейки с целевым, отключить переопределение kv_size.
  • Функция fit теперь учитывает необязательную вторую модель, обеспечивая измерение её памяти при каждом изменении основного контекста для точности пути reduce.

Это обновление устраняет проблемы стабильности в серверных развертываниях за счёт динамического согласования размеров контекстов черновика и целевого.