تم تحديث تنفيذ CUDA لإعطاء الأولوية لاستراتيجيات جدولة البلاطات الكاملة لـ FlashAttention. يهدف هذا التغيير إلى تحسين تدفق التنفيذ لآليات الانتباه داخل الإطار.
تفضل CUDA جدولة البلاطات الكاملة في FlashAttention
يقدم Eqx-zoo منافذ Equinox المُتحقّق منها لنماذج Hugging Face
قام المؤلف ببناء eqx-zoo، وهي مكتبة تحمّل نقاط التفتيش من Hugging Face Hub مباشرةً كوحدات عادية من Equinox وتتحقق من كل نموذج مقابل مكتبة transformers. يدعم المشروع حاليًا Llama و Qwen2 و Qwen3 و Qwen3-MoE للتوليد، و BERT و RoBERTa و XLM-RoBERTa للتضمينات.
إصدار llama.cpp b11401 يصلح التسجيل ويمكّن ألوان ANSI على ويندوز
يُعالج إصدار llama.cpp b11401 مشاكل التسجيل في وضع التوجيه الخادم ويضيف دعمًا لألوان ANSI على وحدة تحكم ويندوز. يضمن هذا التحديث أن سجلات العمليات الفرعية مفصولة بشكل صحيح عن أوامر الحالة وأن الإخراج الملون يُعرض بشكل صحيح على طرفيات ويندوز.
أليف ألفا تطلق كولibri، نموذج MoE ثنائي اللغة الإنجليزية والألمانية بـ 78.1 مليار معلمة مع 3.46 مليار معلمة نشطة
أطلقت أليف ألفا كولibri-1، وهو نموذج لغوي من نوع Mixture-of-Experts ذو أوزان مفتوحة مصمم لمهام ثنائية اللغة الإنجليزية والألمانية. يتميز النموذج بـ 78.1 مليار معلمة إجمالاً، لكنه ينشط فقط 3.46 مليار معلمة لكل توكن، مما يتيح تشغيله على بطاقة GPU واحدة من نوع B200 أو B300 أو H200.
إصلاح llama.cpp b11390 لخطأ ذاكرة CUDA MMQ
أصدر مشروع llama.cpp الإصدار b11390، والذي يتضمن إصلاحًا لخطأ ذاكرة CUDA MMQ الذي حدث عندما كان عدد الخبراء أكبر بكثير من حجم الدفعة الدقيقة.
يضيف llama.cpp b11382 دعم f16 إلى WebGPU fill/set_rows
أصدر مشروع llama.cpp الإصدار b11382، والذي يتضمن تحديثًا رئيسيًا لخلفيته WebGPU. يضيف هذا الإصدار دعم النقطة العائمة 16 بت (f16) تحديدًا لعمليات `fill` و `set_rows` داخل تنفيذ WebGPU.