Le projet llama.cpp a publié la compilation b11227, qui inclut des optimisations de performance spécifiquement ciblées sur la gestion du drapeau `causal_attn` lors du traitement multimodal.

  • Le planificateur ne réserve plus de mémoire lors du basculement de `causal_attn`, éliminant les passes coûteuses qui ralentissaient auparavant les entrées visuelles pour des modèles comme Gemma.
  • La forme du biais de l'indexeur qwen4exp est désormais indépendante de `causal_attn`, empêchant les échecs de réallocation de tampon sous les contraintes de `GGML_SCHED_NO_REALLOC`.
  • Les benchmarks sur llama-server avec gemma-4-26B-A4B montrent des réductions significatives de latence, telles qu'une accélération de 7.61x pour 24 images sur RTX 4090 et jusqu'à 3.40x sur H200 avec des paramètres de contexte large.

Ces modifications améliorent la vitesse d'inférence pour les entrées multi-images et vidéo sans altérer la sortie générée ou le comportement de reconstruction du graphe.