Proyek llama.cpp merilis build b11238, memperkenalkan implementasi padding kiri yang terpadu melalui fungsi `ggml_pad_ext` baru. Perubahan ini menyatukan metode sebelumnya yang digunakan oleh encoder audio seperti Parakeet, LFM2-Audio, Granite Speech, dan Gemma 4, memastikan embedding yang identik secara bit untuk Gemma 4 sambil menyederhanakan dukungan backend.
- Node `ggml_pad_ext` menangani padding kiri dalam satu operasi sekarang bahwa semua backend mendukungnya, menggantikan logika penggabungan roll atau pengisian nol yang kompleks.
- Pembaruan ini mencakup optimasi untuk melewatkan tap DFlash2 yang hanya membaca data padding, karena suku-suku pada atau setelah block_size adalah nol.
- Binari pra-dibuat tersedia untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows, dan openEuler.
Rilis ini meningkatkan konsistensi di berbagai arsitektur model dengan menstandarisasi operasi padding dan menyediakan binari yang diperbarui untuk berbagai platform perangkat keras.