O projeto llama.cpp lançou a versão b10594, que inclui uma correção para pular o loop device_info quando o nível de log não está definido como LOG_LEVEL_TRACE. Anteriormente, esse loop iterava sobre os dispositivos descobertos para consultar as contagens de memória, exigindo a criação de contextos GPU que resultavam em uma alocação de 550 MB de VRAM mesmo quando os dados eram descartados.

  • A alteração impede o uso desnecessário de recursos da GPU verificando o nível de verbosidade antes de iterar.
  • Os binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e iOS.
  • O lançamento também fornece binários da interface do usuário e atestações para verificação.

Esta atualização ajuda usuários que não desejam usar nenhum recurso de GPU a evitar a sobrecarga de criar contextos e alocar VRAM quando as informações do dispositivo não são necessárias.