Turboderp 发布了 ExLlamaV3 的重大更新,引入了针对混合专家(MoE)专家的 CPU 卸载功能。此次更新还包括对新发布的 GLM-5.3-Flash 和 Qwen3.8-Flash 模型的支持。

  • 专门针对 MoE 专家实现的 CPU 卸载。
  • 支持具有 ngram 磁盘卸载功能的 Qwen-3.8-Flash-Next。
  • 通过 exl3 格式集成 GLM-5.3-Flash。
  • 引入一种新的自校准优化技术。
  • 对引擎进行的 various 其他优化和改进。

这些更新扩展了 ExLlamaV3 的硬件灵活性和模型兼容性,允许用户利用 CPU 资源处理特定的模型组件。