Turboderp выпустил значительные обновления ExLlamaV3, внедрив возможности выгрузки на CPU для экспертов Mixture of Experts (MoE). Обновление также включает поддержку недавно выпущенных моделей GLM-5.3-Flash и Qwen3.8-Flash.

  • Реализация выгрузки на CPU специально для экспертов MoE.
  • Поддержка Qwen-3.8-Flash-Next с возможностями выгрузки ngram на диск.
  • Интеграция GLM-5.3-Flash через формат exl3.
  • Внедрение новой техники самонастраивающейся оптимизации.
  • Различные другие оптимизации и улучшения движка.

Эти обновления расширяют гибкость аппаратного обеспечения и совместимость моделей ExLlamaV3, позволяя пользователям использовать ресурсы CPU для определенных компонентов модели.