한 사용자가 ilsp/Llama-Krikri-8B-Instruct 체크포인트를 사용하여 로컬 배포용 무검열 그리스어 네이티브 대규모 언어 모델을 구축할 계획입니다. 제안된 계획은 Heretic(heretic-llm)을 사용하여 모델을 제거하고, GGUF Q4_K_M 형식으로 변환한 후 AMD Ryzen AI MAX+ 395 프로세서와 Vulkan을 탑재한 GMKtec EVO-X3에서 추론을 실행하는 것입니다.
사용자는 이 워크플로우의 여러 기술적 측면에 대한 커뮤니티 조언을 구하고 있습니다:
- Heretic이 Llama-Krikri-8B 또는 기타 그리스어 파인튜닝 모델을 제거하는지 여부.
- 처리 순서: 변환 전에 safetensors를 제거하는 것과 GGUF 파일에서 직접 abliterate.cpp를 사용하는 것 중 최적의 방법.
- Strix Halo 하드웨어에서 품질과 속도를 균형 있게 맞추기 위한 최상의 양자화 수준(Q4_K_M, Q5_K_M 또는 Q6_K).
- -ngl 99, -c 32768, 플래시 어텐션, q8_0 KV 캐시, 추론적 디코딩과 같은 권장 llama.cpp Vulkan 플래그.
- Krikri, Meltemi 또는 Sophea 외에 다른 기존 무검열 그리스어 모델 식별.