Пользователь планирует создать нецензурную, нативную греческую большую языковую модель для локального развертывания с использованием чекпоинта ilsp/Llama-Krikri-8B-Instruct. Предложенный план включает абляцию модели с помощью Heretic (heretic-llm), конвертацию в формат GGUF Q4_K_M и выполнение инференса на устройстве GMKtec EVO-X3, оснащенном процессором AMD Ryzen AI MAX+ 395, через Vulkan.
Пользователь ищет советы сообщества по нескольким техническим аспектам этого рабочего процесса:
- Поддерживает ли Heretic абляцию Llama-Krikri-8B или других греческих дообученных моделей.
- Оптимальная последовательность обработки: абляция safetensors перед конвертацией versus использование abliterate.cpp непосредственно на файлах GGUF.
- Лучший уровень квантования (Q4_K_M, Q5_K_M или Q6_K) для баланса качества и скорости на оборудовании Strix Halo.
- Рекомендуемые флаги Vulkan для llama.cpp, такие как -ngl 99, -c 32768, flash attention, KV cache q8_0 и спекулятивное декодирование.
- Выявление любых других существующих нецензурных греческих моделей помимо Krikri, Meltemi или Sophea.