llama.cpp b10994 रिलीज़ में Metal बैकएंड के लिए एक सुधार शामिल है जो `mul_mm_id` ऑपरेशन में NaN आउटपुट को हल करता है जब एक्टिवेशन मान f16 रेंज से अधिक हो जाते हैं। यह दोष पहले Apple Silicon डिवाइस पर 32 टोकन या उससे अधिक के प्रीफिल चरणों के दौरान Mistral Small 4 जैसे मॉडलों द्वारा पूरी तरह से NaN शब्दावली उत्पन्न करने का कारण बनता था।

  • सुधार f16 सीमाओं में फिट होने के लिए src1 को दो की घात से पुनः स्केल करता है और f32 एकुमुलेटर पर स्केल को रद्द करता है, जिससे सटीक परिणाम बिना किसी सटीकता हानि के सुनिश्चित होते हैं।
  • M2 Max पर प्रदर्शन बेंचमार्क प्रभावित पथों के लिए +1.14% का मध्यिका ओवरहेड दिखाते हैं, जिसमें बड़े बैच साइज थोड़े उच्च लागत की ओर ले जाते हैं।
  • रिलीज़ में macOS (Apple Silicon और Intel), iOS, Linux (CPU, CUDA, ROCm, OpenVINO, SYCL), Android और विभिन्न हार्डवेयर कॉन्फ़िगरेशन के लिए Windows के लिए बाइनरी प्रदान की गई हैं।