El proyecto llama.cpp ha lanzado la versión b11460, que introduce soporte para el formato de cuantización IQ3_S multi-column MMVQ dentro de su backend SYCL. Esta actualización se incluye en la nueva compilación junto con las opciones estándar de aceleración de CPU y GPU.

  • El lanzamiento añade soporte para IQ3_S multi-column MMVQ a la implementación de SYCL a través del pull request #29500.
  • Se proporcionan binarios para macOS (Apple Silicon e Intel), Linux (x64, arm64, s390x), Windows, Android y openEuler.
  • La aceleración de GPU está disponible mediante CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO y OpenCL Adreno en las plataformas compatibles.
  • Se incluyen compilaciones específicas para dispositivos Snapdragon en Linux y Android, que admiten CPU, GPU Adreno y NPU Hexagon.

Este lanzamiento permite a los usuarios acceder a las últimas optimizaciones de SYCL y amplía la compatibilidad con hardware para ejecutar modelos llama.cpp en diversas arquitecturas.