Proyek llama.cpp telah merilis versi 0.5.0, dengan fokus pada kinerja backend, cakupan model yang lebih luas, dan operasi server yang lebih andal. Pembaruan ini memperkenalkan dukungan untuk arsitektur baru seperti HRM-Text (DFM Mimir 1B) dan MiMo-V2.6, sambil secara signifikan meningkatkan efisiensi komputasi melalui optimisasi CUDA dan Metal.
- Mempercepat operasi CUDA conv2d menggunakan implicit GEMM.
- Menambahkan optimisasi fusi Metal MoE dan SSM_CONV.
- Memungkinkan server untuk mengikat ke beberapa alamat melalui alamat TCP yang dipisahkan koma dan soket UNIX.
- Mengaktifkan output gambar dari panggilan fungsi dengan menambahkan dukungan input_image.
- Memperbarui ggml ke v0.25.0, memperluas dukungan hyper-connection dan flash-attention di berbagai backend.
Rilis ini meningkatkan stabilitas untuk anak-anak yang dibuat oleh router dan memperbaiki beberapa masalah parser obrolan, memastikan operasi yang lebih andal bagi pengguna yang menerapkan llama.cpp di lingkungan produksi.