Проект llama.cpp выпустил сборку b10645, вводя новую опцию командной строки --n-cpu-ffn. Эта функция позволяет пользователям указывать количество слоев, веса плотной прямого распространения (FFN) которых выгружаются на CPU.

  • Добавлена опция --n-cpu-ffn для управления выгрузкой весов плотной FFN на CPU для первых N слоев.
  • Устранено дублирование циклов переопределения для опций --n-cpu-moe и --spec-draft-n-cpu-moe.
  • Обобщен llm_ffn_block_regex над паттерном регулярного выражения FFN.

Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) и ускорителей ИИ.