O projeto llama.cpp lançou a compilação b10150, que inclui ajustes na lógica do ggml para operações de offloading para o backend dos pesos. Esta atualização também aborda correções para o grafo llama dsv4.

  • ggml: ajustar a lógica para offload de ops para o backend dos pesos
  • llama: correções do grafo dsv4

Esta versão fornece binários atualizados para macOS, Linux, Windows, Android e iOS em vários backends de hardware, incluindo CPU, CUDA, Vulkan, ROCm e OpenVINO.