O projeto llama.cpp lançou a versão b10738, fornecendo binários para macOS, Linux, Windows, Android e openEuler em CPU, GPU e vários backends de aceleradores.

  • O lançamento inclui uma atualização específica para o suporte SYCL que limita a memória máxima de alocação para 2 GB para memória fixada ao host.
  • As compilações do macOS Apple Silicon com KleidiAI estão desativadas nesta versão.
  • O suporte preview para CUDA 13 no Windows arm64 está incluído.
  • Os binários ROCm 7.14 e OpenVINO 2026.3.1 estão disponíveis para Ubuntu e Windows.

Esta atualização permite que os usuários acessem a funcionalidade mais recente do llama.cpp em hardware suportado, com atenção específica às restrições de memória nas implementações SYCL.