O projeto llama.cpp lançou a versão b10930, que inclui uma correção para o componente do servidor para permitir downloads de modelos mesmo quando o usuário atingiu seu limite de modelos.

  • Resolve a issue #26809 habilitando downloads no limite (PR #28530).
  • Fornece binários para macOS Apple Silicon e Intel, iOS, Ubuntu x64/arm64/s390x, Android arm64, Windows x64/arm64 e openEuler.
  • Suporta vários backends de hardware incluindo CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL FP32/FP16, CUDA 12/13 e OpenCL Adreno.

Esta atualização garante a funcionalidade contínua para usuários que atingem cotas de armazenamento enquanto fornece amplo suporte de plataforma.