Rilis llama.cpp b10666 memperluas suite test-save-load-state untuk berjalan di semua arsitektur dan menyelesaikan beberapa bug kritis dalam manajemen keadaan dan penanganan grafik. Perubahan utama meliputi perbaikan referensi menggantung pada minimax-01, penyelarasan penyalinan chunk untuk sekuens on-device, serta koreksi jumlah kepala indexer untuk deepseek4.

  • Suite test-save-load-state kini berjalan terhadap setiap model *.gguf melalui mode --models DIR baru, menggantikan keterbatasan model tunggal sebelumnya.
  • Logika salinan sekuens keadaan on-device dilonggarkan untuk menangani sumber non-kontigu dengan menggunakan kursor byte alih-alih memerlukan penyelarasan chunk yang tepat.
  • Parameter indexer DSA dummy diperbarui (key_length=128, head_count=64) untuk memastikan operasi Fused Lightning Indexer berjalan pada GPU daripada jatuh kembali ke CPU.
  • Jumlah kepala indexer deepseek4 ditetapkan menjadi 64 agar sesuai dengan persyaratan kernel yang telah diperbaiki, mencegah peringatan ketidakcocokan perangkat.
  • Referensi hparams menggantung pada input grafik LA minimax-01 diganti dengan salinan untuk mencegah korupsi memori tumpuk selama penggunaan ulang grafik.

Pembaruan ini meningkatkan cakupan pengujian dan stabilitas untuk arsitektur kompleks seperti deepseek4, gemma2, dan minimax-01, memastikan serialisasi keadaan berfungsi dengan benar di berbagai backend perangkat keras.