O projeto llama.cpp lançou a versão b10795, que inclui uma nova otimização para o backend SYCL. Esta atualização permite a fusão das cadeias RMS_NORM+MUL+ADD e ADD+ADD residual sob a flag GGML_SYCL_ENABLE_FUSION.

  • A operação fundida ADD+ADD reutiliza o mesmo índice de broadcast e matriz de tipos da função add() independente, suportando f32, f16, i32, i16, bf16 e dados não contíguos.
  • Combinações não suportadas na lógica de fusão retornam a dois lançamentos separados de add() para manter a compatibilidade.

Este lançamento fornece binários para macOS, Linux, Windows, Android e openEuler em vários aceleradores de hardware, incluindo CUDA, ROCm, Vulkan e OpenVINO.