Turboderp telah merilis pembaruan signifikan untuk ExLlamaV3, memperkenalkan kemampuan offload CPU untuk ahli Mixture of Experts (MoE). Pembaruan ini juga mencakup dukungan untuk model GLM-5.3-Flash dan Qwen3.8-Flash yang baru dirilis.

  • Implementasi offload CPU secara khusus untuk ahli MoE.
  • Dukungan untuk Qwen-3.8-Flash-Next dengan kemampuan offload ngram ke disk.
  • Integrasi GLM-5.3-Flash melalui format exl3.
  • Pengenalan teknik optimisasi self-calibrated baru.
  • Berbagai optimisasi dan peningkatan lainnya pada mesin.

Pembaruan ini memperluas fleksibilitas perangkat keras dan kompatibilitas model ExLlamaV3, memungkinkan pengguna memanfaatkan sumber daya CPU untuk komponen model tertentu.