Rilis llama.cpp b11372 memperkenalkan optimisasi untuk indexer lightning model qwen4exp, terutama dengan memangkas memori yang diperlukan untuk skor indexer selama pemrosesan konteks panjang. Hal ini dicapai dengan menghitung skor head secara in-place daripada membuat tensor terpisah untuk setiap head.

  • Indexer qwen4exp sekarang menggunakan kembali buffer allocator dan menghitung skor melalui ggml_lightning_indexer untuk mengurangi penggunaan memori puncak.
  • Dukungan backend CUDA ditambahkan untuk indexer lightning dengan 4 head, yang mendispatch mereka ke kernel vektor.
  • Backend Metal diperbarui untuk membaca jumlah head dari konstanta fungsi, memungkinkan jumlah head apa pun berjalan tanpa perubahan kode.
  • Backend Vulkan men-tile indexer lightning di atas kunci dan token menggunakan memori bersama dan perkalian titik fp16.

Perubahan ini meningkatkan efisiensi memori untuk model qwen4exp dengan konteks panjang sambil mempertahankan ukuran buffer komputasi dan kecepatan.