Proyek llama.cpp merilis build b10712, memperkenalkan shader pengurutan radix top-k baru yang dirancang untuk Vulkan untuk mendukung nilai k yang lebih besar atau sama dengan 1024. Pembaruan ini secara khusus menargetkan model Qwen 3.8 Flash Next dan mencakup uji terkait serta fusi top-k qsa.

  • Ditambahkan shader pengurutan radix top-k untuk k >= 1024 di backend Vulkan.
  • Termasuk uji top-k Qwen 3.8 Flash Next untuk memvalidasi fungsionalitas baru.
  • Mengimplementasikan fusi top-k qsa dan melakukan pembersihan kode.

Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan iOS melalui CPU, GPU (CUDA, ROCm, OpenCL, SYCL), dan backend khusus AI (OpenVINO, KleidiAI).