あるユーザーは、ilsp/Llama-Krikri-8B-Instructのチェックポイントを使用して、ローカルデプロイ向けの無制限なギリシャ語ネイティブの大規模言語モデルを構築する計画を立てています。提案された計画には、Heretic (heretic-llm) を用いてモデルをアンラーニングし、GGUF Q4_K_M形式に変換し、AMD Ryzen AI MAX+ 395プロセッサとVulkanを搭載したGMKtec EVO-X3で推論を実行することが含まれます。

ユーザーは、このワークフローのいくつかの技術的側面についてコミュニティからのアドバイスを探しています:

  • HereticがLlama-Krikri-8Bや他のギリシャ語ファインチューニングモデルをアンラーニングできるかどうか。
  • 処理の最適な順序: safetensorsをアンラーニングしてから変換するか、GGUFファイルに対して直接abliterate.cppを使用するか。
  • Strix Haloハードウェア上で品質と速度のバランスを取るための最適な量子化レベル (Q4_K_M、Q5_K_M、またはQ6_K)。
  • -ngl 99、-c 32768、flash attention、q8_0 KV cache、speculative decodingなどの推奨されるllama.cppのVulkanフラグ。
  • Krikri、Meltemi、Sophea以外の既存の無制限なギリシャ語モデルの特定。