Turboderp a publié des mises à jour significatives pour ExLlamaV3, introduisant des capacités de déchargement vers le CPU pour les experts de Mixture of Experts (MoE). La mise à jour inclut également la prise en charge des nouveaux modèles GLM-5.3-Flash et Qwen3.8-Flash.
- Implémentation du déchargement vers le CPU spécifiquement pour les experts MoE.
- Prise en charge de Qwen-3.8-Flash-Next avec des capacités de déchargement de ngram sur disque.
- Intégration de GLM-5.3-Flash via le format exl3.
- Introduction d'une nouvelle technique d'optimisation auto-calibrée.
- Diverses autres optimisations et améliorations du moteur.
Ces mises à jour étendent la flexibilité matérielle et la compatibilité des modèles d'ExLlamaV3, permettant aux utilisateurs d'exploiter les ressources CPU pour des composants spécifiques du modèle.