El proyecto llama.cpp lanzó la compilación b11227, que incluye optimizaciones de rendimiento específicamente dirigidas al manejo del indicador `causal_attn` durante el procesamiento multimodal.

  • El programador ya no reserva memoria nuevamente al cambiar `causal_attn`, eliminando pases costosos que anteriormente ralentizaban las entradas visuales para modelos como Gemma.
  • La forma de sesgo del indexador qwen4exp ahora es independiente de `causal_attn`, evitando fallos de realocación de búfer bajo las restricciones de `GGML_SCHED_NO_REALLOC`.
  • Las pruebas en llama-server con gemma-4-26B-A4B muestran reducciones significativas de latencia, como una aceleración de 7.61x para 24 imágenes en RTX 4090 y hasta 3.40x en H200 con configuraciones de contexto grande.

Estos cambios mejoran la velocidad de inferencia para entradas de múltiples imágenes y video sin alterar la salida generada o el comportamiento de reconstrucción del grafo.