Проект llama.cpp выпустил сборку b10076, которая вносит оптимизацию производительности в бэкенд CUDA за счёт векторизации операции `get_rows` с использованием копирования int4. Это изменение выносит работу, не зависящую от строки, из цикла по элементам, и добавляет векторизованный путь, копирующий 16 байт на поток для непрерывных данных одного типа.
Реализация контролируется на этапе компиляции и выполнения, требуя выравнивания по 16 байтам и определённых условий шага для обеспечения корректности. Вентиль загрузки (occupancy gate) предотвращает регрессию при малых сборах одной строки, оставляя их на скалярном пути. На Strix Halo (gfx1151) эта оптимизация снизила латентность сбора рекуррентного состояния DeltaNet с 18.6 мкс до 13.0 мкс.
Релиз включает бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL и OpenCL.