Um usuário está planejando construir um modelo de linguagem grande nativo em grego e sem censura para implantação local usando o checkpoint ilsp/Llama-Krikri-8B-Instruct. O plano proposto envolve ablatorar o modelo com Heretic (heretic-llm), convertê-lo para o formato GGUF Q4_K_M e executar inferência em um GMKtec EVO-X3 equipado com processador AMD Ryzen AI MAX+ 395 via Vulkan.

O usuário está buscando conselhos da comunidade sobre vários aspectos técnicos deste fluxo de trabalho:

  • Se o Heretic suporta ablatorar Llama-Krikri-8B ou outros fine-tunes em grego.
  • A sequência ideal para processamento: ablatorar safetensors antes da conversão versus usar abliterate.cpp diretamente em arquivos GGUF.
  • O melhor nível de quantização (Q4_K_M, Q5_K_M ou Q6_K) para equilibrar qualidade e velocidade no hardware Strix Halo.
  • Flags Vulkan recomendadas do llama.cpp, como -ngl 99, -c 32768, flash attention, cache KV q8_0 e decodificação especulativa.
  • Identificação de quaisquer outros modelos gregos sem censura além de Krikri, Meltemi ou Sophea.