O projeto llama.cpp lançou a compilação b11238, introduzindo uma implementação unificada de preenchimento à esquerda por meio da nova função `ggml_pad_ext`. Essa alteração consolida os métodos anteriores usados por codificadores de áudio como Parakeet, LFM2-Audio, Granite Speech e Gemma 4, garantindo embeddings bit a bit idênticos para o Gemma 4 enquanto simplifica o suporte ao backend.

  • O nó `ggml_pad_ext` lida com o preenchimento à esquerda em uma única operação agora que todos os backends o suportam, substituindo a lógica complexa de rolagem ou concatenação com preenchimento zero.
  • A atualização inclui uma otimização para ignorar taps do DFlash2 que apenas leem dados de preenchimento, pois os termos no bloco_size ou além dele são zero.
  • Binários pré-compilados estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows e openEuler.

Este lançamento melhora a consistência entre diferentes arquiteturas de modelos ao padronizar as operações de preenchimento e fornece binários atualizados para uma ampla gama de plataformas de hardware.