Le projet llama.cpp a publié la compilation b10645, introduisant la nouvelle option de ligne de commande --n-cpu-ffn. Cette fonctionnalité permet aux utilisateurs de spécifier le nombre de couches dont les poids du réseau feed-forward (FFN) dense sont déchargés vers le CPU.

  • Ajoute --n-cpu-ffn pour contrôler le déchargement sur CPU des poids FFN denses pour les N premières couches.
  • Dédouble les boucles de remplacement pour les options --n-cpu-moe et --spec-draft-n-cpu-moe.
  • Généralise llm_ffn_block_regex sur le motif d'expression régulière FFN.

La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) et accélérateurs IA.