Proyek llama.cpp telah merilis versi b10201, yang mencakup peningkatan kunci pada backend ggml-webgpu. Pembaruan ini meningkatkan kinerja flash attention saat menangani cache kunci-nilai terkuantisasi selama generasi konteks panjang.
- Pemrosesan vektor flash attention yang lebih baik untuk cache KV terkuantisasi di ggml-webgpu.
- Memperbaiki bug terkait pemeriksaan tipe nilai dan memperbarui komentar.
- Menyelesaikan kesalahan build yang disebabkan oleh rebasing.
- Menyediakan biner untuk macOS (Apple Silicon, Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL), dan openEuler.
Rilis ini memungkinkan pengguna menjalankan llama.cpp di berbagai platform perangkat keras sambil mendapatkan manfaat dari mekanisme perhatian yang dioptimalkan untuk urutan yang lebih panjang.