Проект llama.cpp выпустил версию b10514, которая внедряет инфраструктуру конвертации для архитектур IBM's GraniteSWAForCausalLM и GraniteMoeSWAForCausalLM. Это обновление позволяет пользователям конвертировать эти конкретные типы моделей в формат GGUF для использования с llama.cpp.

  • Добавлена поддержка feat(convert) для GraniteSWAForCausalLM и GraniteMoeSWAForCausalLM.
  • Реализована инфраструктура конвертации для массивов rope_pattern и определения rope на уровне каждого слоя.
  • Исправлена логика паттерна SWA для поддержки non-rope слоев и исправлено наименование для ffn gate inp.
  • Обновлен llama_hparams с константами has_rope и удалены хаковые fallbacks rope_finetuned.
  • Включены бинарные файлы для macOS, Linux, Windows и Android для CPU, CUDA, Vulkan, OpenCL и других бэкендов.

Это обновление позволяет экосистеме llama.cpp нативно поддерживать модели IBM's sliding window attention, расширяя диапазон совместимых архитектур, доступных для локального вывода.