Turboderp выпустил значительные обновления ExLlamaV3, внедрив возможности выгрузки на CPU для экспертов Mixture of Experts (MoE). Обновление также включает поддержку недавно выпущенных моделей GLM-5.3-Flash и Qwen3.8-Flash.
- Реализация выгрузки на CPU специально для экспертов MoE.
- Поддержка Qwen-3.8-Flash-Next с возможностями выгрузки ngram на диск.
- Интеграция GLM-5.3-Flash через формат exl3.
- Внедрение новой техники самонастраивающейся оптимизации.
- Различные другие оптимизации и улучшения движка.
Эти обновления расширяют гибкость аппаратного обеспечения и совместимость моделей ExLlamaV3, позволяя пользователям использовать ресурсы CPU для определенных компонентов модели.