Proyek llama.cpp telah merilis build b11370, yang mencakup optimasi CUDA untuk menggabungkan ahli bersama ke dalam arsitektur Mixture of MoE dengan Kuantisasi Vektor (MMVQ). Perubahan ini merupakan bagian dari pull request #29184 dan juga menangani pemeriksaan buffer null serta penanganan argumen untuk stride_col_dst.

  • Menggabungkan ahli bersama ke MMVQ untuk backend CUDA.
  • Menambahkan pemeriksaan null untuk buffer guna meningkatkan stabilitas.
  • Memindahkan stride_col_dst ke argumen penggabungan.

Rilis ini menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan iOS di berbagai akselerator perangkat keras termasuk CPU, Vulkan, ROCm, OpenVINO, SYCL, dan Snapdragon.