Proyek llama.cpp telah merilis build b10593, yang mengatasi masalah kritis dengan arsitektur model DeepseekV4. Pembaruan ini secara khusus menyelesaikan kegagalan rollback yang terjadi selama pemrosesan multi-sekuens.

  • Memperbaiki penanganan rollback DeepseekV4 untuk konteks multi-sekuens.
  • Memperbaiki prosedur pemuatan model umum.
  • Membuat operasi rollback yang tertunda menjadi satu kali pakai untuk mencegah korupsi state.
  • Memastikan cache hanya dibersihkan untuk ID sekuens tertentu selama pemuatan penuh.
  • Menambahkan asersi untuk rasio kompresi dan membuat topologi grafik statis.

Rilis ini meningkatkan stabilitas bagi pengguna yang menjalankan model DeepseekV4 dengan beberapa sekuens. Ini juga menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan iOS di berbagai backend perangkat keras termasuk CPU, CUDA, ROCm, dan Vulkan.