O projeto llama.cpp lançou a compilação b10069, que inclui atualizações específicas do OpenCL para GPUs Qualcomm Adreno. A principal alteração envolve suportar operações de transmissão para o kernel Adreno MUL_MAT e respeitar deslocamentos de visualização para a variante Q8_0 MUL_MAT para habilitar a funcionalidade multi-stream no llama-server.

  • Adicionado suporte de transmissão para kernels GEMM/GEMV noshuffle do Adreno.
  • Garantido que os deslocamentos de visualização são tratados corretamente para operações GEMM/GEMV noshuffle do Adreno.
  • Implementado suporte geral de transmissão GEMM/GEMV dentro do backend OpenCL.
  • Removidos testes e comentários desnecessários da base de código.

Esta atualização melhora a compatibilidade com cargas de trabalho multi-stream em hardware Adreno ao corrigir problemas críticos de manipulação de kernels.