El proyecto llama.cpp lanzó la compilación b10322, que incluye una optimización de rendimiento que coalesce las cargas de ventanas SSM_CONV en el backend SYCL.

  • En un Arc Pro B70, las pruebas A/B entrelazadas mostraron una aceleración de 1.85x a 1.87x para formas de tensor específicas, con un cambio despreciable para n_t=1.
  • Los benchmarks en modelos Qwen35 27B Q4_K - Medium que ejecutan ssm_conv en 48 de los 64 bloques indicaron una mejora del +2.2% en el tiempo de procesamiento de la solicitud.
  • La versión proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) y openEuler.

Esta actualización mejora el rendimiento de inferencia para cargas de trabajo que utilizan operaciones SSM_CONV en hardware compatible.