Le projet llama.cpp a publié la version b10795, qui inclut une nouvelle optimisation pour le backend SYCL. Cette mise à jour permet la fusion des chaînes RMS_NORM+MUL+ADD et ADD+ADD residual sous le drapeau GGML_SYCL_ENABLE_FUSION.

  • L'opération fusionnée ADD+ADD réutilise le même indexage de broadcast et la même matrice de types que la fonction add() indépendante, prenant en charge f32, f16, i32, i16, bf16 et les données non contiguës.
  • Les combinaisons non prises en charge dans la logique de fusion reviennent à deux lancements séparés de add() pour maintenir la compatibilité.

Cette version fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur divers accélérateurs matériels, y compris CUDA, ROCm, Vulkan et OpenVINO.