Проект llama.cpp выпустил версию b10514, которая внедряет инфраструктуру конвертации для архитектур IBM's GraniteSWAForCausalLM и GraniteMoeSWAForCausalLM. Это обновление позволяет пользователям конвертировать эти конкретные типы моделей в формат GGUF для использования с llama.cpp.
- Добавлена поддержка feat(convert) для GraniteSWAForCausalLM и GraniteMoeSWAForCausalLM.
- Реализована инфраструктура конвертации для массивов rope_pattern и определения rope на уровне каждого слоя.
- Исправлена логика паттерна SWA для поддержки non-rope слоев и исправлено наименование для ffn gate inp.
- Обновлен llama_hparams с константами has_rope и удалены хаковые fallbacks rope_finetuned.
- Включены бинарные файлы для macOS, Linux, Windows и Android для CPU, CUDA, Vulkan, OpenCL и других бэкендов.
Это обновление позволяет экосистеме llama.cpp нативно поддерживать модели IBM's sliding window attention, расширяя диапазон совместимых архитектур, доступных для локального вывода.