llama.cpp 프로젝트는 버전 b10615를 출시하며 Metal 백엔드를 위한 per-device tuned quantized (Q, NE) flash-attention 벡터 연산을 도입했습니다.

  • f16 flash-attn 벡터 인스턴스화 53개를 추가하여 총수를 80에서 133으로 증가시켰습니다.
  • shared memory capacity fallback이 있는 tuning table 및 dispatch wiring을 구현했습니다.
  • quantized KV caches를 지원하기 위해 벡터 튜닝을 확장했습니다.
  • M1 Pro, M2 Ultra 및 M5 Max 장치에 대한 tuned 파라미터를 포함했습니다.

이 업데이트는 Metal 백엔드에 특정 튜닝 결과를 적용하여 Apple Silicon 하드웨어의 성능을 최적화합니다.