Proyek llama.cpp merilis build b10701, yang mencakup perbaikan untuk model draf DFlash2 NVFP4. Pembaruan ini mengatasi masalah di mana model-model ini menghasilkan hampir tidak ada token spekulatif yang diterima.

  • Melewati skala NVFP4 yang hilang ke operasi perhatian dalam pull request #28000.
  • Memastikan bahwa skala proyeksi Q, K, V, dan keluaran dilewatkan dengan benar ke operasi grafik yang sesuai.

Perubahan ini memulihkan fungsionalitas yang tepat untuk model DFlash2 NVFP4 dengan memperbaiki propagasi skala yang diperlukan untuk decoding spekulatif.