El proyecto llama.cpp lanzó la compilación b11238, introduciendo una implementación unificada de relleno a la izquierda mediante la nueva función `ggml_pad_ext`. Este cambio consolida los métodos anteriores utilizados por codificadores de audio como Parakeet, LFM2-Audio, Granite Speech y Gemma 4, asegurando incrustaciones bit a bit idénticas para Gemma 4 mientras simplifica el soporte del backend.
- El nodo `ggml_pad_ext` maneja el relleno a la izquierda en una sola operación ahora que todos los backends lo admiten, reemplazando la lógica compleja de concatenación con roll o relleno de ceros.
- La actualización incluye una optimización para omitir los taps de DFlash2 que solo leen datos de relleno, ya que los términos en o después del block_size son cero.
- Los binarios precompilados están disponibles para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows y openEuler.
Esta versión mejora la consistencia entre diferentes arquitecturas de modelos al estandarizar las operaciones de relleno y proporciona binarios actualizados para una amplia gama de plataformas de hardware.