llama.cpp 프로젝트는 DeepseekV4 모델 아키텍처와 관련된 중대한 문제를 해결한 빌드 b10593을 출시했습니다. 이 업데이트는 다중 시퀀스 처리 중에 발생한 롤백 실패를 구체적으로 해결합니다.
- 다중 시퀀스 컨텍스트에 대한 DeepseekV4 롤백 처리를 수정했습니다.
- 일반적인 모델 로딩 절차를 수정했습니다.
- 상태 손상을 방지하기 위해 대기 중인 롤백 작업을 단일 사용으로 변경했습니다.
- 전체 로딩 중 캐시가 특정 시퀀스 ID에 대해서만 지워지도록 보장합니다.
- 압축 비율에 대한 어설션을 추가하고 그래프 토폴로지를 정적으로 만들었습니다.
이 릴리스는 여러 시퀀스와 함께 DeepseekV4 모델을 실행하는 사용자의 안정성을 향상시킵니다. 또한 CPU, CUDA, ROCm 및 Vulkan을 포함한 다양한 하드웨어 백엔드에서 macOS, Linux, Windows, Android 및 iOS용 업데이트된 바이너리를 제공합니다.