llama.cpp 프로젝트는 빌드 b10645를 출시하며 새로운 명령줄 옵션 --n-cpu-ffn을 도입했습니다. 이 기능은 사용자가 밀집 피드포워드 네트워크(FFN) 가중치를 CPU로 오프로드할 레이어 수를 지정할 수 있게 합니다.
- 첫 N개 레이어의 밀집 FFN 가중치 CPU 오프로딩을 제어하기 위해 --n-cpu-ffn 추가.
- --n-cpu-moe 및 --spec-draft-n-cpu-moe 옵션에 대한 재정의 루프 중복 제거.
- FFN 정규식 패턴에 걸쳐 llm_ffn_block_regex 일반화.
이번 릴리스는 CPU, GPU(CUDA, Vulkan, ROCm, OpenCL) 및 AI 가속기 백엔드를 위한 macOS, Linux, Windows, Android, openEuler용 바이너리를 제공합니다.