Proyek llama.cpp telah menambahkan dukungan untuk dekode spekulatif DFlash dengan model HunyuanOCR dengan mengekspos tensor input lapisan dalam grafik target. Perubahan ini memungkinkan model draf membaca aliran residual, sehingga permintaan gambar dapat berjalan sukses dengan tingkat penerimaan draf sekitar 0,5 dan output OCR yang identik secara byte dibandingkan dengan eksekusi non-spekulatif.
Pembaruan ini juga memperbaiki konversi draf DFlash terhadap target HunYuan, menyelesaikan dua kegagalan spesifik: AttributeError yang disebabkan oleh penanganan vocab yang tidak terikat dan pencarian konfigurasi yang salah membaca parameter draf alih-alih konfigurasi target. Perbaikan ini memastikan bahwa konversi draf DFlash tencent/HunyuanOCR berhasil untuk checkpoint versi 1,5 dan v1,0 tanpa mengubah konversi model dasar.
Perubahan-perubahan ini memungkinkan dekode spekulatif yang efisien untuk model berbasis Hunyuan di llama.cpp, meningkatkan kecepatan inferensi sambil mempertahankan kesetiaan output.