Proyek llama.cpp merilis build b10737, yang mengatasi bug kritis dalam dukungan arsitektur qwen4exp. Pembaruan ini menyelesaikan masalah persistensi status urutan dan mencegah penghentian CUDA selama pemuatan model.

  • Memperbaiki keruntuhan NaN kvu dan memulihkan data cache indexer ext.x/ext.y selama perjalanan bolak-balik penyimpanan/pemulihan untuk model qwen4exp.
  • Mengoreksi derivasi jumlah baris per_layer_token_embd dan menolak dereferensi pointer null pada lapisan cache rekursif PLE.
  • Menonaktifkan flag tensor -sm untuk qwen4exp, yang sebelumnya menyebabkan logits NaN dan crash pada perangkat nyata.
  • Mengubah nama seq_set menjadi seq_get_all untuk menyelesaikan konflik kelebihan beban fungsi dan menambahkan pengujian yang memverifikasi integritas status.

Perubahan ini memastikan bahwa model qwen4exp dapat dimuat dan disimpan tanpa korupsi data atau kesalahan runtime, terutama saat menggunakan konten mrope 2D atau lapisan PLE.