O projeto llama.cpp lançou a versão b11460, que introduz suporte para o formato de quantização IQ3_S multi-column MMVQ em seu backend SYCL. Esta atualização está incluída na nova compilação junto com as opções padrão de aceleração de CPU e GPU.
- O lançamento adiciona suporte a IQ3_S multi-column MMVQ à implementação do SYCL por meio do pull request #29500.
- Binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (x64, arm64, s390x), Windows, Android e openEuler.
- A aceleração de GPU está disponível via CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO e OpenCL Adreno nas plataformas suportadas.
- Compilações específicas estão incluídas para dispositivos Snapdragon no Linux e Android, suportando CPU, GPU Adreno e NPU Hexagon.
Este lançamento permite que os usuários acessem as últimas otimizações do SYCL e amplia a compatibilidade de hardware para executar modelos llama.cpp em diversas arquiteturas.