O projeto llama.cpp lançou a compilação b10293, que inclui a integração contínua da AMD ROCm para a arquitetura gfx1151 e resolve problemas de correção em GPUs integradas com RDNA3.5.

  • Corrige o test-recurrent-state-rollback no gfx1151 permitindo buffers de saída do host da GPU integrada em asserções de depuração.
  • Restaura a correção da inferência no RDNA3.5 habilitando memória unificada para contornar problemas de coerência da GPU com pesos carregados via mmap.
  • Corrige erros de execução assíncrona no caminho HIP utilizando HIP_LAUNCH_BLOCKING=1 para serializar lançamentos de kernels.
  • Ignora testes da arquitetura jamba e subtestes top-k no backend HIP devido a operações não suportadas e saída incorreta.

Esta atualização permite testes e inferência confiáveis de modelos llama.cpp em hardware AMD RDNA3.5 via ROCm.