O projeto llama.cpp lançou a versão b11090, que inclui uma correção para um erro de compilação de tile sm_70. A atualização generaliza a forma do tile da função load_ldmatrix de 5 argumentos para resolver incompatibilidades com as arquiteturas Volta.

  • Corrige erros de compilação no sm_70 generalizando as formas dos tiles de load_ldmatrix de <16,8> para <I,J>.
  • Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, CUDA, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenCL, OpenVINO, SYCL, ROCm), Android e openEuler.

Este lançamento garante compatibilidade com arquiteturas de GPU mais antigas enquanto mantém o suporte em uma ampla gama de sistemas operacionais e aceleradores de hardware.