Proyek llama.cpp telah merilis versi b10425, yang mencakup port optimasi SYCL untuk menggabungkan salinan penulisan kembali keadaan gated-delta-net.

  • Perubahan ini meningkatkan kinerja sekitar 1,2% pada perangkat keras Arc Pro B70 saat menjalankan Qwen 3.6 27B dengan lintas A/B berselang-seling.
  • Latensi pra-penuh (pp2048) tetap datar, sementara kecepatan generasi token meningkat sedikit.
  • Binari tersedia untuk macOS, Linux, Windows, Android, dan openEuler di backend CPU, CUDA, Vulkan, ROCm, OpenVINO, dan SYCL.

Rilis ini menyediakan build yang diperbarui untuk berbagai platform dan akselerator untuk mendukung optimasi model terbaru.