llama.cpp 프로젝트는 MiniMax-M3 모델에 대한 초기 비전 지원을 도입하는 빌드 b10142를 출시했습니다. 이 업데이트는 기존 구성 요소를 재사용하는 텍스트 전용 포트를 구현했으며, 여기에는 헤드별 QK 정규화와 부분 회전, DeepSeek-V3 스타일 전문가, swigluoai 활성화가 포함된 GQA가 포함됩니다.
- 구현에는 MTP 헤드와 희소 주의 지원을 제거한 채 MiniMax-M3 비전 타워(mmproj + clip 그래프)가 포함됩니다.
- 성능 최적화에는 긴 컨텍스트에서 엄청난 속도 향상을 위해 느린 CPU 연산을 GPU/CPU 연산으로 분해하고 인덱서 연산을 CUDA 네이티브로 재작성하는 작업이 포함됩니다.
- 통합된 4-way + 디코드 경로는 레이어당 노드 수를 약 50개에서 약 25개로 줄여 계산 버퍼를 약 20% 축소합니다.
- 측정된 결과에 따르면 전문가 오프로드 설정에서 디코드 속도가 초당 6.2–7.15 토큰에서 초당 7.7–7.8 토큰으로 증가했으며, 프리필드가 약 10% 빨라졌습니다.
이 변경 이전에 생성된 모든 GGUF는 새로운 아키텍처 및 변환 로직과의 호환성을 보장하기 위해 재생성해야 합니다.