llama.cpp 프로젝트는 Volta GPU용 CUDA 최적화를 포함한 버전 b11335를 출시했습니다. 이 업데이트는 sm_70 아키텍처를 일반 구성으로 폴스루하는 대신 기존 Turing MMVQ nwarps 테이블로 라우팅합니다.
- Volta (sm_70)은 이제 K-quant batch-1 디코딩에 TURING 튜닝을 사용하며, warp 수를 4에서 2로 변경합니다.
- Qwen3.8-27B가 탑재된 Tesla V100에서의 벤치마크는 비트 단위 퍼플렉시티가 동일하게 유지된 채 처리량이 +3.17% (+1.091 t/s) 증가했음을 보여줍니다.
- 이 변경은 anyei/llamacpp-v100 포크에서 유래했으며, 디바이스 및 호스트 테이블 선택자 모두에 적용됩니다.
이 조정은 모델 정확도에 영향을 주지 않고 Volta 하드웨어의 추론 속도를 향상시킵니다.