أصدر مشروع llama.cpp الإصدار b11362، والذي يقدم نواة انتباه فلاش جديدة لواجهة برمجة التطبيقات الموترية تدعم تخزين المفاتيح والقيم (KV) بتنسيق F16. يتوفر هذا التحديث عبر منصات macOS وLinux وWindows وAndroid وiOS مع خيارات خلفية مختلفة بما في ذلك CUDA وVulkan وROCm.
- يضيف نوى FA موترية لأبعاد محددة: DK=DV=512، DK=576/DV=512، وDK=192/DV=128.
- تدعم النواة الجديدة آليات attention sinks وALiBi وlogit softcap.
- يتم توفير ثنائيات جاهزة مسبقًا لخلفيات CPU وGPU (CUDA 12/13، Vulkan، ROCm 10.0) وNPU (Snapdragon Hexagon).
يتيح هذا الإصدار حساب انتباه أكثر كفاءة على تكوينات الأجهزة المدعومة.