El proyecto llama.cpp lanzó la compilación b10645, introduciendo la nueva opción de línea de comandos --n-cpu-ffn. Esta función permite a los usuarios especificar el número de capas cuyos pesos de red feed-forward (FFN) densos se descargan en la CPU.

  • Añade --n-cpu-ffn para controlar la descarga en CPU de los pesos FFN densos para las primeras N capas.
  • Deduplica bucles de anulación para las opciones --n-cpu-moe y --spec-draft-n-cpu-moe.
  • Generaliza llm_ffn_block_regex sobre el patrón de expresión regular FFN.

El lanzamiento proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de backends de CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) y aceleradores de IA.