Seorang pengguna berencana membangun model bahasa besar (LLM) asli bahasa Yunani tanpa sensor untuk penyebaran lokal menggunakan checkpoint ilsp/Llama-Krikri-8B-Instruct. Rencana yang diusulkan melibatkan abliterasi model dengan Heretic (heretic-llm), konversi ke format GGUF Q4_K_M, dan menjalankan inferensi pada perangkat GMKtec EVO-X3 yang dilengkapi prosesor AMD Ryzen AI MAX+ 395 melalui Vulkan.
Pengguna mencari saran komunitas mengenai beberapa aspek teknis dari alur kerja ini:
- Apakah Heretic mendukung abliterasi Llama-Krikri-8B atau fine-tune bahasa Yunani lainnya.
- Urutan optimal untuk pemrosesan: abliterasi safetensors sebelum konversi versus menggunakan abliterate.cpp secara langsung pada file GGUF.
- Tingkat kuantisasi terbaik (Q4_K_M, Q5_K_M, atau Q6_K) untuk menyeimbangkan kualitas dan kecepatan pada perangkat keras Strix Halo.
- Flag Vulkan yang direkomendasikan untuk llama.cpp, seperti -ngl 99, -c 32768, flash attention, cache KV q8_0, dan decoding spekulatif.
- Identifikasi model bahasa Yunani tanpa sensor lainnya yang sudah ada di luar Krikri, Meltemi, atau Sophea.