Local inference
github llama.cpp · 17 jam lalu · 9 tayangan

llama.cpp menambahkan dukungan DFlash untuk HunyuanOCR dan memperbaiki konversi draf

Proyek llama.cpp telah menambahkan dukungan untuk dekode spekulatif DFlash dengan model HunyuanOCR dengan mengekspos tensor input lapisan dalam grafik target. Perubahan ini memungkinkan model draf membaca aliran residual, sehingga permintaan gambar dapat berjalan sukses dengan tingkat penerimaan draf sekitar 0,5 dan output OCR yang identik secara byte dibandingkan dengan eksekusi non-spekulatif.

media Hugging Face Forums · 1 hari lalu · 11 tayangan

Pengguna mencari alur kerja untuk abliterasi Llama-Krikri-8B-Instruct guna penggunaan bahasa Yunani secara lokal

Seorang pengguna berencana membangun model bahasa besar (LLM) asli bahasa Yunani tanpa sensor untuk penyebaran lokal menggunakan checkpoint ilsp/Llama-Krikri-8B-Instruct. Rencana yang diusulkan melibatkan abliterasi model dengan Heretic (heretic-llm), konversi ke format GGUF Q4_K_M, dan menjalankan inferensi pada perangkat GMKtec EVO-X3 yang dilengkapi prosesor AMD Ryzen AI MAX+ 395 melalui Vulkan.