O projeto llama.cpp lançou a compilação b11382, que inclui uma atualização importante para seu backend do WebGPU. Este lançamento adiciona suporte de ponto flutuante de 16 bits (f16) especificamente para as operações `fill` e `set_rows` dentro da implementação do WebGPU.

  • A alteração no código-fonte está rastreada no pull request #29897 no repositório ggml-org/llama.cpp.
  • Binários estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.
  • O lançamento também inclui o binário padrão da interface do usuário do llama.cpp.