Seorang pengguna telah merilis Juud_engine, sebuah fork eksperimental berlisensi MIT dari Strata v0.1.39 yang dirancang untuk inferensi lokal model Qwen3.8-Flash-Next pada perangkat keras konsumen seperti RTX 4090. Proyek ini memperkenalkan dua perubahan dekode sisi CPU yang dapat diaktifkan secara opsional: pemendekan putaran pekerja setelah batch ahli CPU dan penghindaran kuantisasi aktivasi CPU untuk token yang sepenuhnya dialihkan ke GPU.

  • Benchmark pada i7-13700 dan RTX 4090 menunjukkan peningkatan throughput dekade berpasangan median sebesar 3,1–9,1% dan perbaikan latensi sebesar 0,5–5,6% di berbagai panjang konteks.
  • Jalur kontrol terpisah dengan pengaturan cache berbeda melaporkan peningkatan throughput yang lebih tinggi sebesar 9,6–15,6%, meskipun konsistensi output bervariasi antar konfigurasi pengujian.
  • Repositori menyertakan diff sumber, instruksi build, hash model, dan skrip verifikasi untuk replikasi independen.

Penulis mengundang masukan mengenai metodologi benchmark dan meminta replikasi independen untuk memvalidasi klaim kinerja.