أصدر مشروع llama.cpp الإصدار b10514، الذي يقدم بنية تحويل لهندسات IBM's GraniteSWAForCausalLM وGraniteMoeSWAForCausalLM. يتيح هذا التحديث للمستخدمين تحويل أنواع النماذج المحددة هذه إلى تنسيق GGUF للاستخدام مع llama.cpp.

  • تمت إضافة دعم feat(convert) لـ GraniteSWAForCausalLM وGraniteMoeSWAForCausalLM.
  • تم تنفيذ بنية التحويل لمصفوفات rope_pattern وتحديد rope لكل طبقة.
  • تم إصلاح منطق نمط SWA لدعم الطبقات non-rope وتصحيح التسمية لـ ffn gate inp.
  • تم تحديث llama_hparams بثوابت has_rope وإزالة fallbacks rope_finetuned hacky.
  • تم تضمين ملفات ثنائية لـ macOS وLinux وWindows وAndroid عبر CPU وCUDA وVulkan وOpenCL وغيرها من backends.

يتيح هذا الإصدار لنظام llama.cpp البيئي دعم نماذج IBM's sliding window attention بشكل أصلي، مما يوسع نطاق الهندسات المتوافقة المتاحة للاستدلال المحلي.