O projeto llama.cpp lançou a versão b11460, que introduz suporte para o formato de quantização IQ3_S multi-column MMVQ em seu backend SYCL. Esta atualização está incluída na nova compilação junto com as opções padrão de aceleração de CPU e GPU.

  • O lançamento adiciona suporte a IQ3_S multi-column MMVQ à implementação do SYCL por meio do pull request #29500.
  • Binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (x64, arm64, s390x), Windows, Android e openEuler.
  • A aceleração de GPU está disponível via CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO e OpenCL Adreno nas plataformas suportadas.
  • Compilações específicas estão incluídas para dispositivos Snapdragon no Linux e Android, suportando CPU, GPU Adreno e NPU Hexagon.

Este lançamento permite que os usuários acessem as últimas otimizações do SYCL e amplia a compatibilidade de hardware para executar modelos llama.cpp em diversas arquiteturas.