Proyek llama.cpp merilis build b10142, yang memperkenalkan dukungan visi awal untuk model MiniMax-M3. Pembaruan ini mengimplementasikan port teks-saja yang menggunakan kembali komponen yang ada dari MiniMax-M2, termasuk GQA dengan QK-norm per-kepala dan rotary parsial, ahli gaya DeepSeek-V3, dan aktivasi swigluoai.

  • Implementasi mencakup menara visi MiniMax-M3 (mmproj + grafik clip) sambil menghapus kepala MTP dan dukungan perhatian sparse.
  • Optimisasi kinerja termasuk mengurai operasi CPU lambat menjadi operasi GPU/CPU untuk percepatan besar pada konteks panjang dan menulis ulang op indexer agar menjadi native CUDA.
  • Jalur 4-way + decode yang terpadu mengurangi jumlah node per lapisan dari ~50 menjadi ~25, memperkecil buffer komputasi sekitar 20%.
  • Efek terukur menunjukkan kecepatan decode meningkat dari 6.2–7.15 t/s menjadi 7.7–7.8 t/s pada setup offload ahli, dengan prefill menjadi sekitar 10% lebih cepat.

Semua GGUF yang dihasilkan sebelum perubahan ini harus dibuat ulang untuk memastikan kompatibilitas dengan arsitektur dan logika konversi baru.