Le projet llama.cpp a publié la version b11238, introduisant une implémentation unifiée du remplissage à gauche via la nouvelle fonction `ggml_pad_ext`. Ce changement consolide les méthodes précédentes utilisées par les encodeurs audio tels que Parakeet, LFM2-Audio, Granite Speech et Gemma 4, garantissant des embeddings bit-à-bit identiques pour Gemma 4 tout en simplifiant le support des backends.
- Le nœud `ggml_pad_ext` gère le remplissage à gauche en une seule opération désormais que tous les backends le prennent en charge, remplaçant la logique complexe de concaténation par roll ou remplissage par zéros.
- La mise à jour inclut une optimisation pour ignorer les taps de DFlash2 qui ne lisent que des données de remplissage, car les termes à partir de block_size sont nuls.
- Des binaires précompilés sont disponibles pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows et openEuler.
Cette version améliore la cohérence entre différentes architectures de modèles en standardisant les opérations de remplissage et fournit des binaires mis à jour pour un large éventail de plateformes matérielles.