llama.cpp 프로젝트가 빌드 b10758을 출시하며 Hexagon DSP에 대한 MUL_MAT 및 MUL_MAT_ID 융합 기능을 도입했습니다. 이 업데이트에는 Qualcomm 하드웨어의 안정성과 성능을 개선하기 위한 여러 수정 사항도 포함되어 있습니다.

  • HMX에 도달하는 QKV 및 FFN 행렬 곱셈을 융합합니다.
  • 고정된 ne[1] < 32K 제한을 제거합니다.
  • 큰 차원에서 vtcm 예산을 초과하지 않도록 오버헤드 크기 조정 수정.
  • 가능한 경우 MUL_MAT_ID를 MUL_MAT_ID_NX 변형에 융합합니다.
  • 추적 버퍼 할당 오버헤드를 줄이기 위해 opbatch 및 opqueue 크기 업데이트.
  • 단편화로 인한 중단을 피하기 위해 가상 주소 공간 분할 제거 추가.

이러한 변경 사항은 Hexagon 기반 장치의 메모리 사용량 및 실행 효율성을 최적화합니다.