Пользователь планирует создать нецензурную, нативную греческую большую языковую модель для локального развертывания с использованием чекпоинта ilsp/Llama-Krikri-8B-Instruct. Предложенный план включает абляцию модели с помощью Heretic (heretic-llm), конвертацию в формат GGUF Q4_K_M и выполнение инференса на устройстве GMKtec EVO-X3, оснащенном процессором AMD Ryzen AI MAX+ 395, через Vulkan.

Пользователь ищет советы сообщества по нескольким техническим аспектам этого рабочего процесса:

  • Поддерживает ли Heretic абляцию Llama-Krikri-8B или других греческих дообученных моделей.
  • Оптимальная последовательность обработки: абляция safetensors перед конвертацией versus использование abliterate.cpp непосредственно на файлах GGUF.
  • Лучший уровень квантования (Q4_K_M, Q5_K_M или Q6_K) для баланса качества и скорости на оборудовании Strix Halo.
  • Рекомендуемые флаги Vulkan для llama.cpp, такие как -ngl 99, -c 32768, flash attention, KV cache q8_0 и спекулятивное декодирование.
  • Выявление любых других существующих нецензурных греческих моделей помимо Krikri, Meltemi или Sophea.