O projeto llama.cpp lançou a compilação b10645, introduzindo a nova opção de linha de comando --n-cpu-ffn. Este recurso permite que os usuários especifiquem o número de camadas cujos pesos da rede feed-forward (FFN) densa são descarregados para a CPU.
- Adiciona --n-cpu-ffn para controlar o descarregamento em CPU dos pesos FFN densos para as primeiras N camadas.
- Deduplica loops de substituição para as opções --n-cpu-moe e --spec-draft-n-cpu-moe.
- Generaliza llm_ffn_block_regex sobre o padrão de expressão regular FFN.
O lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através de backends de CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) e aceleradores de IA.