O projeto llama.cpp lançou a versão b10330, introduzindo uma otimização do CUDA que funde as operações rms_norm, multiplicação e RoPE em um único kernel. Essa mudança é acompanhada por verificações de intervalo de memória para as operações fundidas e novos casos de teste para pesos de broadcast.

  • CUDA: fundir rms_norm + mul + rope (+ view + set_rows)
  • tests: adicionar caso de peso broadcast ao rms_norm_mul_rope
  • CUDA: verificar intervalos de memória antes da fusão rms_norm rope
  • CUDA: verificar intervalos de memória na fusão set_rows do rope

O lançamento fornece binários para macOS, Linux, Windows, Android e iOS em vários backends de hardware, incluindo CPU, Vulkan, ROCm, OpenVINO, SYCL e HIP.