Proyek llama.cpp telah merilis versi b10900, yang mencakup pembaruan teknis pada backend Vulkan. Rilis ini menambahkan ketergantungan alokasi secara khusus untuk mengaktifkan optimasi fusi topk_moe selama fase prefill.

  • Perubahan kode utama adalah penambahan ketergantungan alokasi dalam implementasi Vulkan untuk mendukung fusi topk_moe untuk operasi prefill.
  • Binari disediakan untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, ROCm 10.0, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0), Android, dan iOS.
  • Dukungan KleidiAI untuk macOS Apple Silicon dinonaktifkan dalam build ini.

Pembaruan ini memberikan kepada pengguna kinerja prefill yang dioptimalkan pada perangkat keras yang kompatibel dengan Vulkan melalui teknik fusi yang baru diaktifkan.