Un utilisateur prévoit de construire un grand modèle de langage natif au grec et sans censure pour un déploiement local en utilisant le checkpoint ilsp/Llama-Krikri-8B-Instruct. Le plan proposé implique d'abréger le modèle avec Heretic (heretic-llm), de le convertir au format GGUF Q4_K_M, et d'exécuter l'inférence sur un GMKtec EVO-X3 équipé d'un processeur AMD Ryzen AI MAX+ 395 via Vulkan.
L'utilisateur cherche des conseils de la communauté sur plusieurs aspects techniques de ce workflow :
- Si Heretic prend en charge l'abréation de Llama-Krikri-8B ou d'autres fine-tunes grecs.
- La séquence optimale pour le traitement : abréger les safetensors avant la conversion versus utiliser abliterate.cpp directement sur les fichiers GGUF.
- Le meilleur niveau de quantisation (Q4_K_M, Q5_K_M ou Q6_K) pour équilibrer qualité et vitesse sur le matériel Strix Halo.
- Les drapeaux Vulkan recommandés pour llama.cpp, tels que -ngl 99, -c 32768, flash attention, cache KV q8_0, et le décodage spéculatif.
- L'identification de tout autre modèle grec sans censure existant au-delà de Krikri, Meltemi ou Sophea.