El proyecto llama.cpp lanzó la versión b10984, introduciendo soporte CUDA para operaciones SUM_ROWS contiguas por filas. Esta actualización también organiza el código para incluir GGML_OP_MEAN para manejar tensores contiguos por filas mediante un kernel compartido.
- Añadido soporte CUDA para SUM_ROWS contiguo por filas.
- Código organizado para añadir GGML_OP_MEAN para tensores contiguos por filas usando un kernel compartido.
- Incluidas pruebas para operaciones de permutación y corte MEAN.
- Proporcionados binarios para macOS, Linux, Windows, Android y openEuler a través de backends CPU, CUDA, Vulkan, ROCm, OpenVINO y SYCL.
El lanzamiento asegura la compatibilidad con varios aceleradores de hardware y sistemas operativos para inferencia local.