O projeto llama.cpp lançou a versão b10519, que inclui uma refactorização significativa do mecanismo de manipulação de suspensão do servidor. Esta alteração permite que o endpoint /metrics permaneça acessível enquanto o servidor está em estado de suspensão.
- Refatorada a lógica on_sleeping_state e separadas as tarefas/resultados de métricas e slots.
- Adicionadas respostas em cache e corrigida uma condição de corrida no temporizador da tarefa de métricas.
- Corrigido get_res_model_info e atualizada a documentação.
- Fornecidos binários para macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, ROCm), Android e openEuler.