Проект llama.cpp выпустил версию b10313, которая внедряет планировщик LRU (Least Recently Used) для его серверного компонента. Это обновление включает обработку слияния запросов и исправления для случаев потоковой передачи.

  • Сервер теперь поддерживает планировщик LRU для управления соединениями.
  • Реализована логика слияния запросов для обработки выхода из очереди ожидания.
  • Добавлены тесты для проверки нового поведения планирования.
  • Исправлена ошибка, влияющая на случай потоковой передачи.

Этот релиз предоставляет обновленные бинарные файлы для macOS, Linux, Windows, Android и iOS для различных аппаратных бэкендов, включая CPU, CUDA, Vulkan, ROCm и OpenVINO.