Proyek llama.cpp merilis build b10645, memperkenalkan opsi baris perintah baru --n-cpu-ffn. Fitur ini memungkinkan pengguna menentukan jumlah lapisan yang bobot jaringan feed-forward (FFN) padatnya di-offload ke CPU.

  • Menambahkan --n-cpu-ffn untuk mengontrol offload CPU bobot FFN padat untuk N lapisan pertama.
  • Mendeduplikasi loop override untuk opsi --n-cpu-moe dan --spec-draft-n-cpu-moe.
  • Menggeneralisasi llm_ffn_block_regex di atas pola regex FFN.

Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), dan akselerator AI.