Proyek llama.cpp merilis build b10645, memperkenalkan opsi baris perintah baru --n-cpu-ffn. Fitur ini memungkinkan pengguna menentukan jumlah lapisan yang bobot jaringan feed-forward (FFN) padatnya di-offload ke CPU.
- Menambahkan --n-cpu-ffn untuk mengontrol offload CPU bobot FFN padat untuk N lapisan pertama.
- Mendeduplikasi loop override untuk opsi --n-cpu-moe dan --spec-draft-n-cpu-moe.
- Menggeneralisasi llm_ffn_block_regex di atas pola regex FFN.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), dan akselerator AI.