llama.cpp 프로젝트는 rms_norm, 곱셈, RoPE 연산을 단일 커널로 융합하는 CUDA 최적화를 도입한 버전 b10330을 출시했습니다. 이 변경에는 융합된 연산에 대한 메모리 범위 확인과 브로드캐스트 가중치를 위한 새로운 테스트 케이스가 포함됩니다.

  • CUDA: rms_norm + mul + rope (+ view + set_rows) 융합
  • tests: rms_norm_mul_rope에 브로드캐스트 가중치 케이스 추가
  • CUDA: rms_norm rope 융합 전 메모리 범위 확인
  • CUDA: rope set_rows 융합 중 메모리 범위 확인

이 릴리스는 CPU, Vulkan, ROCm, OpenVINO, SYCL, HIP을 포함한 다양한 하드웨어 백엔드용 macOS, Linux, Windows, Android, iOS 바이너리를 제공합니다.