O projeto llama.cpp lançou a versão b10984, introduzindo suporte CUDA para operações SUM_ROWS contíguas por linha. Esta atualização também organiza o código para incluir GGML_OP_MEAN para lidar com tensores contíguos por linha por meio de um kernel compartilhado.
- Adicionado suporte CUDA para SUM_ROWS contíguo por linha.
- Código organizado para adicionar GGML_OP_MEAN para tensores contíguos por linha usando um kernel compartilhado.
- Incluídos testes para operações de permutação e fatiamento MEAN.
- Fornecidos binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, Vulkan, ROCm, OpenVINO e SYCL.
O lançamento garante compatibilidade com vários aceleradores de hardware e sistemas operacionais para inferência local.