El proyecto llama.cpp lanzó la versión b10984, introduciendo soporte CUDA para operaciones SUM_ROWS contiguas por filas. Esta actualización también organiza el código para incluir GGML_OP_MEAN para manejar tensores contiguos por filas mediante un kernel compartido.

  • Añadido soporte CUDA para SUM_ROWS contiguo por filas.
  • Código organizado para añadir GGML_OP_MEAN para tensores contiguos por filas usando un kernel compartido.
  • Incluidas pruebas para operaciones de permutación y corte MEAN.
  • Proporcionados binarios para macOS, Linux, Windows, Android y openEuler a través de backends CPU, CUDA, Vulkan, ROCm, OpenVINO y SYCL.

El lanzamiento asegura la compatibilidad con varios aceleradores de hardware y sistemas operativos para inferencia local.