El proyecto llama.cpp lanzó la versión b10791, introduciendo optimizaciones significativas de OpenCL para cabezales de modelos de lenguaje cuantificados y operaciones de GEMV de descodificación. Esta actualización también incluye mejoras de GEMM en lotes medianos relevantes para la descodificación especulativa y la predicción de múltiples tokens.

  • Optimiza opencl quant lm_head / decode GEMV y GEMM de lote mediano para descodificación especulativa/MTP.
  • Protege el registro del kernel de conversión tiled_ns q4_K/q6_K para compilaciones que no sean Adreno.
  • Dirige la fusión de dispatch MUL_MAT+GLU de q4_K específicamente al hardware Adreno.
  • Requiere el diseño de pesos noshuffle en el gate de fusión GLU de q4_K.
  • Evita tomar la ruta GEMV mrow f16 vectorizada con pasos de fila no alineados.
  • Habilita decode GEMV split-K de q4_K solo donde se han medido ganancias de rendimiento.
  • Restringe los valores predeterminados de tiled lm_head/embed GEMV a las arquitecturas X2E/A8X.

El lanzamiento proporciona binarios para macOS, iOS, Linux, Windows, Android y openEuler a través de CPU, GPU y varios backends de aceleradores.