Metal 백엔드는 2개에서 16개의 소스 행에 대한 새로운 행렬 곱셈 커널을 도입하여 텐서 API가 없는 Apple Silicon 장치에서 더 빠른 추론 디코딩을 가능하게 합니다. 이 커널은 가중치를 한 번만 디쿼턴라이즈하고 K 차원을 스레드 그룹 간에 분할하여 이전의 mat-vec 접근 방식보다 상당한 성능 향상을 제공합니다.
- Q4_0, Q8_0, Q5_K에 대한 특정 MMA 커널과 F32, F16 및 기타 양자화 유형을 위한 제네릭 경로 구현.
- 행 수가 mat-vec 커널보다 성능이 우수해지는 임계값을 초과할 때 MTLGPUFamilyApple7+ 하드웨어에서 이 커널 활성화.
- MUL_MAT + ADD 연산을 결합하고 배치 크기를 최대 16개의 인접한 동일 레이아웃 f32 복사본으로 단일 디스패치로 묶는 퓨전 로직 추가.
- 퓨즈된 그룹에 대한 장치 속성 처리, 동시성 확인 및 뷰 추적을 위해 그래프 옵티마이저와 인코더 업데이트.
이 최적화는 작은 배치 크기에서도 텐서 연산이 효율적으로 유지되도록 보장하여 M3 Ultra 하드웨어에서의 추론 디코딩 성능 저하를 해결합니다.