Le projet llama.cpp a publié la version b10330, introduisant une optimisation CUDA qui fusionne les opérations rms_norm, multiplication et RoPE en un seul noyau. Ce changement est accompagné de vérifications de plage de mémoire pour les opérations fusionnées et de nouveaux cas de test pour les poids de diffusion.

  • CUDA : fusionner rms_norm + mul + rope (+ view + set_rows)
  • tests : ajouter le cas de poids broadcast à rms_norm_mul_rope
  • CUDA : vérifier les plages de mémoire avant la fusion rms_norm rope
  • CUDA : vérifier les plages de mémoire dans la fusion set_rows de rope

La version fournit des binaires pour macOS, Linux, Windows, Android et iOS sur divers backends matériels, y compris CPU, Vulkan, ROCm, OpenVINO, SYCL et HIP.