O projeto llama.cpp lançou a versão b10313, que introduz um agendador LRU (Least Recently Used) para seu componente de servidor. Esta atualização inclui tratamento de coalescência de requisições e correções para casos de streaming.
- O servidor agora suporta um agendador LRU para gerenciar conexões.
- A lógica de coalescência de requisições foi implementada para lidar com saídas da fila de espera.
- Testes foram adicionados para verificar o novo comportamento de agendamento.
- Um bug que afetava o caso de stream foi corrigido.
Este lançamento fornece binários atualizados para macOS, Linux, Windows, Android e iOS em vários backends de hardware, incluindo CPU, CUDA, Vulkan, ROCm e OpenVINO.