Le projet llama.cpp a publié la version b11046, qui introduit le support OpenCL pour le noyau `flash_attn_f32_f16_bin`. Cette mise à jour inclut également une fonctionnalité de pré-remplissage protégé pour Flash Attention sur les appareils OpenCL.

  • Ajout de l'implémentation du noyau `flash_attn_f32_f16_bin` pour OpenCL.
  • Implémentation de la logique de pré-remplissage protégé pour Flash Attention dans le backend OpenCL.
  • Fourniture de binaires pour macOS (Apple Silicon et Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android et iOS.

Cette version élargit la compatibilité matérielle pour les mécanismes d'attention sur les appareils compatibles OpenCL tout en maintenant un large support entre les principaux systèmes d'exploitation et accélérateurs.