Proyek llama.cpp telah merilis versi b10201, yang mencakup peningkatan kunci pada backend ggml-webgpu. Pembaruan ini meningkatkan kinerja flash attention saat menangani cache kunci-nilai terkuantisasi selama generasi konteks panjang.

  • Pemrosesan vektor flash attention yang lebih baik untuk cache KV terkuantisasi di ggml-webgpu.
  • Memperbaiki bug terkait pemeriksaan tipe nilai dan memperbarui komentar.
  • Menyelesaikan kesalahan build yang disebabkan oleh rebasing.
  • Menyediakan biner untuk macOS (Apple Silicon, Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL), dan openEuler.

Rilis ini memungkinkan pengguna menjalankan llama.cpp di berbagai platform perangkat keras sambil mendapatkan manfaat dari mekanisme perhatian yang dioptimalkan untuk urutan yang lebih panjang.