llama.cpp b10994 릴리스에는 활성화 값이 f16 범위를 초과할 때 `mul_mm_id` 연산에서 NaN 출력을 해결하는 Metal 백엔드에 대한 수정 사항이 포함되어 있습니다. 이 결함으로 인해 이전에는 Apple Silicon 장치에서 32개 이상의 토큰에 대한 프리필 단계 동안 Mistral Small 4와 같은 모델이 완전히 NaN 어휘를 생성했습니다.
- 수정 사항은 src1을 2의 거듭제곱으로 재스케일링하여 f16 제한 내에 맞추고 f32 누적기에서 스케일을 되돌려 정확도 손실 없이 정확한 결과를 보장합니다.
- M2 Max에서의 성능 벤치마크는 영향 받은 경로에 대해 +1.14%의 중앙값 오버헤드를 보여주며, 더 큰 배치 크기는 약간 더 높은 비용을 초래합니다.
- 이 릴리스는 macOS(Apple Silicon 및 Intel), iOS, Linux(CPU, CUDA, ROCm, OpenVINO, SYCL), Android 및 다양한 하드웨어 구성에 대한 Windows용 바이너리를 제공합니다.