CUDA कार्यान्वयन को FlashAttention के लिए पूरे-टाइल शेड्यूलिंग रणनीतियों को प्राथमिकता देने के लिए अपडेट किया गया है। यह बदलाव फ्रेमवर्क के भीतर एटेंशन तंत्र के निष्पादन प्रवाह को अनुकूलित करने का लक्ष्य रखता है।
CUDA को FlashAttention में पूरे-टाइल शेड्यूलिंग पसंद है
Eqx-zoo Hugging Face मॉडलों के लिए सत्यापित Equinox पोर्ट प्रदान करता है
लेखक ने eqx-zoo बनाया है, एक लाइब्रेरी जो Hugging Face Hub चेकपॉइंट्स को सीधे सादे Equinox मॉड्यूल के रूप में लोड करती है और transformers लाइब्रेरी के खिलाफ प्रत्येक मॉडल की सत्यापन करता है। परियोजना वर्तमान में जनरेशन के लिए Llama, Qwen2, Qwen3, Qwen3-MoE और एम्बेडिंग्स के लिए BERT, RoBERTa, XLM-RoBERTa का समर्थन करती है।
llama.cpp b11401 रिलीज़ लॉगिंग ठीक करती है और विंडोज़ पर ANSI रंग सक्षम करती है
llama.cpp b11401 रिलीज़ सर्वर राउटर मोड में लॉगिंग समस्याओं को हल करती है और विंडोज़ कंसोल के लिए ANSI रंगों का समर्थन जोड़ती है। यह अपडेट सुनिश्चित करता है कि चिल्ड प्रोसेस लॉग स्टेट आदेशों से सही तरीके से अलग होते हैं और विंडोज़ टर्मिनलों पर रंगीन आउटपुट उचित रूप से रेंडर होता है।
Aleph Alpha ने Kolibri जारी किया, एक 78.1B अंग्रेजी-जर्मन MoE मॉडल जिसमें 3.46B सक्रिय पैरामीटर हैं
Aleph Alpha ने Kolibri-1 जारी किया है, जो द्विभाषी अंग्रेजी और जर्मन कार्यों के लिए डिज़ाइन किया गया एक ओपन-वेट मिक्स्चर-ऑफ़-एक्सपर्ट्स भाषा मॉडल है। इस मॉडल में कुल 78.1 बिलियन पैरामीटर हैं, लेकिन यह प्रति टोकन केवल 3.46 बिलियन सक्रिय करता है, जिससे इसे एकल B200, B300 या H200 GPU पर चलाया जा सकता है।
llama.cpp b11390 CUDA MMQ मेमोरी फॉल्ट को ठीक करता है
llama.cpp प्रोजेक्ट ने संस्करण b11390 जारी किया है, जिसमें एक CUDA MMQ मेमोरी फॉल्ट के लिए समाधान शामिल है जो तब होता था जब विशेषज्ञों की संख्या माइक्रो-बैच साइज़ से काफी बड़ी होती थी।
llama.cpp b11382 ने WebGPU fill/set_rows के लिए f16 समर्थन जोड़ा
llama.cpp परियोजना ने बिल्ड b11382 जारी किया है, जिसमें इसके WebGPU बैकएंड के लिए एक प्रमुख अपडेट शामिल है। इस रिलीज़ में WebGPU कार्यान्वयन के भीतर `fill` और `set_rows` संचालन के लिए विशेष रूप से 16-बिट फ्लोटिंग-पॉइंट (f16) समर्थन जोड़ा गया है।