Proyek llama.cpp merilis versi b10437, yang memperkenalkan dukungan native untuk model bahasa kausal MiniMax-Text-01 dan MiniMax-M1. Pembaruan ini mencakup skrip konversi yang diperlukan, template obrolan, dan implementasi arsitektur model untuk menjalankan model-model spesifik ini dalam kerangka kerja llama.cpp.
- Menambahkan dukungan untuk `MiniMaxText01ForCausalLM` dan `MiniMaxM1ForCausalLM` pada lapisan model.
- Mengimplementasikan penekanan token untuk embedding dengan nilai nol untuk mencegah gangguan pada proses pengambilan sampel.
- Mengoptimalkan kinerja dengan menghapus operasi transpose state dan menggunakan fungsi umum untuk implementasi yang ringkas.
- Menambahkan template obrolan Jinja khusus untuk MiniMax-M1.
- Termasuk artefak build untuk macOS, Linux, Windows, Android, dan openEuler di CPU, GPU, dan berbagai akselerator.
Rilis ini memungkinkan pengguna menjalankan model MiniMax secara lokal menggunakan infrastruktur inferensi yang ada dari llama.cpp.