Un usuario está planeando construir un modelo de lenguaje grande sin censura y nativo en griego para implementación local utilizando el checkpoint ilsp/Llama-Krikri-8B-Instruct. El plan propuesto implica ablatar el modelo con Heretic (heretic-llm), convertirlo al formato GGUF Q4_K_M y ejecutar inferencia en un GMKtec EVO-X3 equipado con un procesador AMD Ryzen AI MAX+ 395 a través de Vulkan.

El usuario está buscando consejos de la comunidad sobre varios aspectos técnicos de este flujo de trabajo:

  • Si Heretic soporta ablatar Llama-Krikri-8B u otros fine-tunes en griego.
  • La secuencia óptima para el procesamiento: ablatar safetensors antes de la conversión versus usar abliterate.cpp directamente en archivos GGUF.
  • El mejor nivel de cuantización (Q4_K_M, Q5_K_M o Q6_K) para equilibrar calidad y velocidad en el hardware Strix Halo.
  • Banderas Vulkan recomendadas para llama.cpp, como -ngl 99, -c 32768, flash attention, caché KV q8_0 y descodificación especulativa.
  • Identificación de otros modelos griegos sin censura existentes además de Krikri, Meltemi o Sophea.