Проект llama.cpp выпустил версию b10330, внедряющую оптимизацию CUDA, которая объединяет операции rms_norm, умножения и RoPE в одно ядро. Это изменение сопровождается проверкой диапазонов памяти для объединённых операций и новыми тестовыми случаями для весов широковещательной передачи.

  • CUDA: объединить rms_norm + mul + rope (+ view + set_rows)
  • tests: добавить случай веса broadcast в rms_norm_mul_rope
  • CUDA: проверить диапазоны памяти перед объединением rms_norm и rope
  • CUDA: проверить диапазоны памяти при объединении set_rows для rope

Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и iOS на различных аппаратных бэкендах, включая CPU, Vulkan, ROCm, OpenVINO, SYCL и HIP.