El proyecto llama.cpp ha lanzado la versión b10330, introduciendo una optimización de CUDA que fusiona las operaciones rms_norm, multiplicación y RoPE en un solo kernel. Este cambio viene acompañado de comprobaciones de rango de memoria para las operaciones fusionadas y nuevos casos de prueba para pesos de difusión.

  • CUDA: fusionar rms_norm + mul + rope (+ view + set_rows)
  • tests: añadir caso de peso broadcast a rms_norm_mul_rope
  • CUDA: comprobar rangos de memoria antes de la fusión rms_norm rope
  • CUDA: comprobar rangos de memoria en la fusión set_rows de rope

El lanzamiento proporciona binarios para macOS, Linux, Windows, Android e iOS en varios backends de hardware, incluyendo CPU, Vulkan, ROCm, OpenVINO, SYCL y HIP.