O projeto llama.cpp lançou a versão b10984, introduzindo suporte CUDA para operações SUM_ROWS contíguas por linha. Esta atualização também organiza o código para incluir GGML_OP_MEAN para lidar com tensores contíguos por linha por meio de um kernel compartilhado.

  • Adicionado suporte CUDA para SUM_ROWS contíguo por linha.
  • Código organizado para adicionar GGML_OP_MEAN para tensores contíguos por linha usando um kernel compartilhado.
  • Incluídos testes para operações de permutação e fatiamento MEAN.
  • Fornecidos binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, Vulkan, ROCm, OpenVINO e SYCL.

O lançamento garante compatibilidade com vários aceleradores de hardware e sistemas operacionais para inferência local.