Proyek llama.cpp merilis build b10712, memperkenalkan shader pengurutan radix top-k baru yang dirancang untuk Vulkan untuk mendukung nilai k yang lebih besar atau sama dengan 1024. Pembaruan ini secara khusus menargetkan model Qwen 3.8 Flash Next dan mencakup uji terkait serta fusi top-k qsa.
- Ditambahkan shader pengurutan radix top-k untuk k >= 1024 di backend Vulkan.
- Termasuk uji top-k Qwen 3.8 Flash Next untuk memvalidasi fungsionalitas baru.
- Mengimplementasikan fusi top-k qsa dan melakukan pembersihan kode.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan iOS melalui CPU, GPU (CUDA, ROCm, OpenCL, SYCL), dan backend khusus AI (OpenVINO, KleidiAI).