Rilis llama.cpp b11265 mencakup perbaikan untuk penanganan model Mixture of Experts (MoE) oleh backend Vulkan. Pembaruan ini memperbaiki bagaimana `mat_mul_id` memilih tile perkalian matriks, mengatasi masalah kinerja di mana pekerja menganggur selama penjadwalan.

  • Sebelumnya, pemilihan tile bergantung pada jumlah token total, yang salah untuk grid penjadwalan MoE di mana N sebenarnya per kelompok kerja adalah baris per ahli.
  • Pada model seperti Sarvam 30B dengan pp128, kesalahan ini menyebabkan pemilih memilih tile untuk sekitar 6 baris aktif alih-alih 128.
  • Perbaikan memastikan bahwa semua pekerja dalam satu kelompok memiliki pekerjaan, menghilangkan waktu terbuang yang sebelumnya menyumbang 55% dari durasi pekerjaan.

Perubahan ini meningkatkan efisiensi inferensi untuk model MoE di Vulkan dengan memastikan distribusi beban kerja yang tepat di antara pekerja GPU.