Проект llama.cpp выпустил версию b10313, которая внедряет планировщик LRU (Least Recently Used) для его серверного компонента. Это обновление включает обработку слияния запросов и исправления для случаев потоковой передачи.
- Сервер теперь поддерживает планировщик LRU для управления соединениями.
- Реализована логика слияния запросов для обработки выхода из очереди ожидания.
- Добавлены тесты для проверки нового поведения планирования.
- Исправлена ошибка, влияющая на случай потоковой передачи.
Этот релиз предоставляет обновленные бинарные файлы для macOS, Linux, Windows, Android и iOS для различных аппаратных бэкендов, включая CPU, CUDA, Vulkan, ROCm и OpenVINO.