قام مشروع ggml بتحسين أداء AMX عن طريق تسطيح التقسيم على n_batch * M، مما يضمن مشاركة جميع الخيوط في عملية التكميم. هذا التغيير يحسّن السرعة بنسبة تصل إلى 1.47x عبر نماذج وتكوينات عتادية مختلفة على منصات CPU وGPU، مع إظهار النتائج مكاسب متسقة في وقت الاستدلال.
ggml يحسّن أداء AMX عبر تسطيح التقسيم
إصدار llama.cpp b9741 يضيف ثنائيات جديدة ودعمًا
يُطلق إصدار llama.cpp بـ b9741 ثنائيات جديدة لأنظمة macOS وLinux وAndroid وWindows وopenEuler عبر معماريات متعددة. يتضمن الإصدار دعمًا لـ Vulkan وCUDA 12.4 و13.3 وOpenVINO وSYCL وROCm، مع إصدارات محدثة لنظام iOS وUbuntu.
ggml-webgpu يضيف مفاتيح تبديل المحول F16 لـ Vulkan وNVIDIA
أضاف مشروع ggml-webgpu مفاتيح تبديل للمحول لدعم الدقة النصفية (F16) على وحدات معالجة الرسومات Vulkan وNVIDIA. يتيح هذا التحديث أداءً محسّنًا على الأجهزة المتوافقة عبر منصات متعددة، بما في ذلك macOS وLinux وAndroid وWindows وopenEuler، مع توفر إصدارات مخصصة لهندسة ARM وx64.
إصدار LLaMA.cpp b9729: ثنائيات جديدة ودعم المنصات
أصدرت LLaMA.cpp الإصدار b9729 مع ملفات ثنائية لأنظمة macOS وLinux وAndroid وWindows وopenEuler عبر بنية متعددة. يتضمن الإصدار دعمًا لـ CPU وVulkan وOpenVINO وSYCL وROCm، بالإضافة إلى حزمة واجهة مستخدم جديدة. تمت إزالة المراجع الداخلية إلى 'webui'.
llama.cpp Release b9703: تحديثات وتنزيلات الثنائيات
يتضمن llama.cpp الإصدار b9703 إعادة هيكلة لـ preset handling الخاص بالسيرفر، مع إزالة دعم preset من HF عن بُعد والدوال المتروكة. يوفر هذا الإصدار ملفات ثنائية (binaries) لأنظمة macOS وLinux وAndroid وWindows وopenEuler عبر بنية متعددة وخيارات تسريع الأجهزة، بما في ذلك Vulkan وCUDA وOpenVINO وSYCL.
إضافة دعم f16 و bf16 لمؤشر concat في الخلفية Metal
تم توسيع الخلفية Metal في llama.cpp لدعم أنواع الموترات f16 و bf16 لمؤشر concat، بالإضافة إلى الدعم الحالي لأنواع f32 و i32. يتضمن هذا التحديث قوالب نواة متخصصة، ومُرجعات خطوط أنابيب محدثة، وتنسيق نواة محسّن بناءً على النوع، بمساعدة من pi:llama.cpp/Qwen3.6-27B.