llama.cpp 프로젝트는 ggml-cuda의 수정 사항을 포함하는 빌드 b10181을 출시했습니다. 이 수정 사항은 블록당 공유 메모리가 48 KiB 미만인 GPU에서 행렬 곱셈 양자화(MMQ)를 비활성화합니다. 이전에는 MMQ 구성이 최소 48 KiB를 가정하여, 타일 크기가 사용 가능한 메모리를 초과하는 NVIDIA Pascal GPU 및 Moore Threads MTT S70과 같은 장치에서 치명적인 오류가 발생했습니다.

  • 수정 사항은 `ggml_cuda_should_use_mmq()`에 공유 메모리 예산을 확인하기 위한 가드를 추가하여 MMQ 타일을 선택하기 전에 검사합니다.
  • 메모리가 부족한 장치는 이제 프리필 단계 동안 BLAS 경로로 폴백되어 코어 덤프를 피하면서도 토큰 생성 성능을 유지합니다.
  • 이 변경 사항은 특정 MUSA QY1 장치뿐만 아니라 블록당 공유 메모리가 48 KiB 미만이라고 보고하는 모든 CUDA 장치에 적용됩니다.

이 업데이트는 제한된 공유 메모리를 가진 구형 또는 특수 하드웨어에서의 충돌을 방지하여 호환 가능한 BLAS 백엔드를 자동으로 사용함으로써 안정적인 추론을 보장합니다.