Uji stres GPU menggunakan Qwen2.5-7B-Instruct beku 4-bit pada pertanyaan jembatan HotpotQA menunjukkan bahwa rute semantik yang sadar tugas secara signifikan meningkatkan efisiensi dan akurasi di bawah kondisi pengganggu tinggi. Studi ini membandingkan konteks penuh yang dibatasi dengan selektor semantik yang sadar kueri, yang mempertahankan 60% dari anggaran, mengungkapkan peningkatan substansial dalam kecepatan dan presisi.

  • Rata-rata token input Qwen turun sebesar 41,32%, dari 13.124,5 menjadi 7.701,8.
  • Waktu prefill rata-rata menurun sebesar 46,85%, dari 870,8 ms menjadi 462,8 ms.
  • Latensi ujung ke ujung termasuk seleksi turun sebesar 45,02%, dari 943,9 ms menjadi 518,9 ms.
  • Penggunaan VRAM puncak berkurang sebesar 2,55 GiB, dari 11,71 GiB menjadi 9,16 GiB.
  • Skor F1 token meningkat sebesar 0,0468, naik dari 0,5342 menjadi 0,5810.

Hasilnya menunjukkan bahwa mempertahankan hanya 60% konteks melalui rute semantik mengurangi biaya komputasi sambil menghasilkan kualitas jawaban yang lebih tinggi, meskipun uji tersebut secara khusus mengukur ketahanan terhadap konteks panjang yang tidak relevan daripada kinerja distribusi alami.