一名用户计划使用 ilsp/Llama-Krikri-8B-Instruct 检查点构建一个无审查、原生希腊语的大语言模型,以便进行本地部署。拟定的计划涉及使用 Heretic (heretic-llm) 对模型进行消融处理,将其转换为 GGUF Q4_K_M 格式,并在配备 AMD Ryzen AI MAX+ 395 处理器的 GMKtec EVO-X3 上通过 Vulkan 运行推理。

该用户正在就此工作流的几个技术方面寻求社区建议:

  • Heretic 是否支持对 Llama-Krikri-8B 或其他希腊语微调模型进行消融。
  • 处理的最佳顺序:在转换前对 safetensors 进行消融,还是直接在 GGUF 文件上使用 abliterate.cpp。
  • 在 Strix Halo 硬件上平衡质量与速度的最佳量化级别(Q4_K_M、Q5_K_M 或 Q6_K)。
  • 推荐的 llama.cpp Vulkan 标志,例如 -ngl 99、-c 32768、flash attention、q8_0 KV cache 以及推测解码。
  • 除了 Krikri、Meltemi 或 Sophea 之外,识别其他现有的无审查希腊语模型。