Rilis llama.cpp b10994 menyertakan perbaikan untuk backend Metal yang menyelesaikan keluaran NaN dalam operasi `mul_mm_id` ketika nilai aktivasi melebihi rentang f16. Cacat ini sebelumnya menyebabkan model seperti Mistral Small 4 menghasilkan kosakata sepenuhnya NaN selama langkah prefill 32 token atau lebih pada perangkat Apple Silicon.
- Perbaikan tersebut menskalakan ulang src1 dengan pangkat dua agar sesuai dengan batas f16 dan membatalkan skala pada akumulator f32, memastikan hasil yang tepat tanpa kehilangan presisi.
- Benchmark kinerja di M2 Max menunjukkan overhead median +1.14% untuk jalur yang terpengaruh, dengan ukuran batch yang lebih besar menimbulkan biaya sedikit lebih tinggi.
- Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, CUDA, ROCm, OpenVINO, SYCL), Android, dan Windows di berbagai konfigurasi perangkat keras.