Проект llama.cpp выпустил версию b10330, внедряющую оптимизацию CUDA, которая объединяет операции rms_norm, умножения и RoPE в одно ядро. Это изменение сопровождается проверкой диапазонов памяти для объединённых операций и новыми тестовыми случаями для весов широковещательной передачи.
- CUDA: объединить rms_norm + mul + rope (+ view + set_rows)
- tests: добавить случай веса broadcast в rms_norm_mul_rope
- CUDA: проверить диапазоны памяти перед объединением rms_norm и rope
- CUDA: проверить диапазоны памяти при объединении set_rows для rope
Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и iOS на различных аппаратных бэкендах, включая CPU, Vulkan, ROCm, OpenVINO, SYCL и HIP.