A versão b9741 do llama.cpp introduz novos binários para macOS, Linux, Android, Windows e openEuler em múltiplas arquiteturas. O lançamento inclui suporte para Vulkan, CUDA 12.4 e 13.3, OpenVINO, SYCL e ROCm, com versões atualizadas para iOS e Ubuntu.
Lançamento do llama.cpp b9741 Adiciona Novos Binários e Suporte
ggml otimiza AMX com achatamento de partição
O projeto ggml otimizou o desempenho do AMX achatando a partição sobre n_batch * M, garantindo que todos os threads participem da quantização. Essa mudança melhora a velocidade em até 1,47x em vários modelos e configurações de hardware nas plataformas de CPU e GPU, com resultados mostrando ganhos consistentes no tempo de inferência.
ggml-webgpu adiciona alternâncias de adaptador F16 para Vulkan e NVIDIA
O projeto ggml-webgpu adicionou alternâncias de adaptador para suporte a precisão meia (F16) em GPUs Vulkan e NVIDIA. Esta atualização permite melhor desempenho em hardware compatível em várias plataformas, incluindo macOS, Linux, Android, Windows e openEuler, com builds específicas disponíveis para as arquiteturas ARM e x64.
LLaMA.cpp lança b9729: Novos Binários e Suporte a Plataformas
O LLaMA.cpp lançou a versão b9729 com binários para macOS, Linux, Android, Windows e openEuler em várias arquiteturas. O lançamento inclui suporte para CPU, Vulkan, OpenVINO, SYCL e ROCm, além de um novo pacote de UI. Referências internas ao 'webui' foram removidas.
Lançamento do llama.cpp b9703: Atualizações e Downloads Binários
A versão b9703 do llama.cpp inclui uma reformulação do tratamento de presets do servidor, removendo o suporte a presets remotos da HF e funções obsoletas. O lançamento fornece binários para macOS, Linux, Android, Windows e openEuler em múltiplas arquiteturas e opções de aceleração de hardware, incluindo Vulkan, CUDA, OpenVINO e SYCL.
Backend Metal adiciona suporte a f16 e bf16 para operador concat
O backend Metal no llama.cpp foi estendido para suportar tipos de tensor f16 e bf16 para o operador concat, além do suporte existente a f32 e i32. Esta atualização inclui modelos de kernel especializados, getters de pipeline atualizados e despacho de kernel baseado em tipo aprimorado, com assistência de pi:llama.cpp/Qwen3.6-27B.