Proyek llama.cpp telah menggabungkan operasi RMS_NORM dan SCALE ke dalam satu kernel CUDA untuk mengurangi overhead host/driver. Sebelumnya, node SCALE terpisah menambahkan peluncuran kernel tambahan yang dapat diabaikan dalam pemrosesan batch biasa tetapi secara signifikan meningkatkan latensi selama decoding spekulatif draft-mtp.
- Penggabungan menambahkan flag do_scale ke rms_norm_f32, memungkinkan jalur gabungan berbagi kernel, reduksi, dan peluncur sambil mempertahankan kesetaraan numerik bit-per-bit.
- Pada setup 2x GTX 1080 Ti dengan Qwen3.8-27B, throughput prefill dingin meningkat sebesar 4,2% untuk 8000 token dan 4,8% untuk 20000 token di bawah kondisi draft-mtp.
- Jumlah peluncuran per ubatch menurun dari 1032,9 + 841,7 kembali ke 978,9 + 799,7, sesuai dengan hitungan baseline sebelumnya tanpa mengubah jumlah operasi GPU.
- Semua pengujian backend untuk RMS_NORM_SCALE, NORM_SCALE, dan operasi terkait berhasil pada kedua GPU, dengan perplexity tetap identik dengan build yang tidak digabungkan.
Optimasi ini meningkatkan kecepatan inferensi secara khusus dalam skenario decoding spekulatif dengan mengurangi biaya kumulatif peluncuran kernel.