Turboderp telah merilis pembaruan signifikan untuk ExLlamaV3, memperkenalkan kemampuan offload CPU untuk ahli Mixture of Experts (MoE). Pembaruan ini juga mencakup dukungan untuk model GLM-5.3-Flash dan Qwen3.8-Flash yang baru dirilis.
- Implementasi offload CPU secara khusus untuk ahli MoE.
- Dukungan untuk Qwen-3.8-Flash-Next dengan kemampuan offload ngram ke disk.
- Integrasi GLM-5.3-Flash melalui format exl3.
- Pengenalan teknik optimisasi self-calibrated baru.
- Berbagai optimisasi dan peningkatan lainnya pada mesin.
Pembaruan ini memperluas fleksibilitas perangkat keras dan kompatibilitas model ExLlamaV3, memungkinkan pengguna memanfaatkan sumber daya CPU untuk komponen model tertentu.