Rilis llama.cpp b10728 memperkenalkan implementasi CUDA untuk XOR swizzle pada tile fp16 memori bersama K,V Flash Attention. Pembaruan ini juga menyelesaikan kondisi race pada memori bersama Flash Attention di perangkat keras DGX Spark.
- Mengimplementasikan flash attention dengan XOR swizzle dan tile fp16 untuk CUDA.
- Memperbaiki penggunaan pointer generik 64-bit alih-alih pointer bersama 32-bit.
- Menambahkan kasus uji swizzle dan membatasi sinkronisasi hanya untuk jalur swizzled.
- Memungkinkan swizzling untuk bentuk non-pangkat-2 di mana nbatch_2%32==0.
- Merestrukturisasi logika ldmatrix swizzle Flash Attention menjadi fungsi pembantu.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, CUDA, Vulkan, ROCm, OpenVINO, dan SYCL.