Um usuário está planejando construir um modelo de linguagem grande nativo em grego e sem censura para implantação local usando o checkpoint ilsp/Llama-Krikri-8B-Instruct. O plano proposto envolve ablatorar o modelo com Heretic (heretic-llm), convertê-lo para o formato GGUF Q4_K_M e executar inferência em um GMKtec EVO-X3 equipado com processador AMD Ryzen AI MAX+ 395 via Vulkan.
O usuário está buscando conselhos da comunidade sobre vários aspectos técnicos deste fluxo de trabalho:
- Se o Heretic suporta ablatorar Llama-Krikri-8B ou outros fine-tunes em grego.
- A sequência ideal para processamento: ablatorar safetensors antes da conversão versus usar abliterate.cpp diretamente em arquivos GGUF.
- O melhor nível de quantização (Q4_K_M, Q5_K_M ou Q6_K) para equilibrar qualidade e velocidade no hardware Strix Halo.
- Flags Vulkan recomendadas do llama.cpp, como -ngl 99, -c 32768, flash attention, cache KV q8_0 e decodificação especulativa.
- Identificação de quaisquer outros modelos gregos sem censura além de Krikri, Meltemi ou Sophea.