MLX लाइब्रेरी ने संस्करण 0.32.1 जारी किया, जिसने अपने मेटल पूर्ण ध्यान कार्यान्वयन के भीतर 72 के हेड आयाम के लिए समर्थन पेश किया।
- अपडेट ने पुल अनुरोध #4330 के माध्यम से मेटल पूर्ण ध्यान में हेड आयाम 72 के उपयोग को सक्षम बनाया।
MLX लाइब्रेरी ने संस्करण 0.32.1 जारी किया, जिसने अपने मेटल पूर्ण ध्यान कार्यान्वयन के भीतर 72 के हेड आयाम के लिए समर्थन पेश किया।
Apple ने अपने तीसरी पीढ़ी के आधार मॉडलों (AFM3) के लिए एक नई आर्किटेक्चर पेश की है जो "निर्देश-अनुसरण प्रuning" का उपयोग करके सक्रिय पैरामीटर गिनती को काफी कम करता है। मॉडल को डिज़ाइन किया गया है ताकि यह अपने MLP परतों का लगभग 20% सक्रिय कर सके, प्रति टोकन के बजाय प्रति प्रम्प्ट एक बार रूटिंग निर्णय लेकर।
Apple वर्तमान में iPhones पर तैनाती के लिए कृत्रिम बुद्धिमत्ता मॉडलों को संपीड़ित करने वाली तकनीक के बारे में स्टार्टअप PrismML के साथ चर्चा कर रहा है।
MLX लाइब्रेरी ने version 0.32.0 जारी किया, जो Metal backend में एक विशिष्ट बग को संबोधित करता है।
शोधकर्ताओं ने BaseRT पेश किया, जो एप्पल सिलिकॉन पर बड़े भाषा मॉडलों के लिए एक नेटिव मेटल इनफरेंस रनटाइम है जो आज तक की उच्चतम रिपोर्ट किए गए इनफरेंस थ्रूपुट को प्राप्त करता है। चिप-विशिष्ट कर्नेल फ्यूजन और यूनिफाइड मेमोरी-अवेयर ऑप्टिमाइजेशन का उपयोग करके, यह llama.cpp और MLX जैसे मौजूदा फ्रेमवर्क्स में पाए जाने वाले ओवरहेड को दूर करता है।
एक सीमा-जागरूक GPU आवंटक का सात परिदृश्यों में FIFO शेड्यूलर के साथ बेंचमार्किंग की गई, जिसमें समान हार्डवेयर पर GPU उपयोग में 33 प्रतिशत बिंदु तक अधिक और प्राथमिकता-भारित आउटपुट में 105% तक अधिक प्राप्त हुआ। सिस्टम रियल-टाइम इनफरेंस मांग को एक स्थिर आरक्षण के बजाय एक उतार-चढ़ाव वाली वक्र के रूप में मानता है, जिससे बैच-जैसे जॉब्स गहराई के दौरान क्षमता को भर सकते हैं जबकि सलग्न GPU ब्लॉक्स और नॉन-प्रिइम्पशन जैसे कठोर सीमाओं का सम्मान करते हुए।
हम ट्रैफ़िक मापने और साइट को बेहतर बनाने के लिए कुकीज़ का उपयोग करते हैं। आप एनालिटिक्स कुकीज़ स्वीकार या अस्वीकार कर सकते हैं। गोपनीयता नीति