O projeto llama.cpp lançou a versão b10313, que introduz um agendador LRU (Least Recently Used) para seu componente de servidor. Esta atualização inclui tratamento de coalescência de requisições e correções para casos de streaming.

  • O servidor agora suporta um agendador LRU para gerenciar conexões.
  • A lógica de coalescência de requisições foi implementada para lidar com saídas da fila de espera.
  • Testes foram adicionados para verificar o novo comportamento de agendamento.
  • Um bug que afetava o caso de stream foi corrigido.

Este lançamento fornece binários atualizados para macOS, Linux, Windows, Android e iOS em vários backends de hardware, incluindo CPU, CUDA, Vulkan, ROCm e OpenVINO.