L'auteur a publié AiiStream Q3.6, une technique open-source qui permet au modèle Qwen3.6-35B-A3B de fonctionner sur des appareils Apple Silicon avec seulement 8 à 16 Go de RAM. En conservant les experts routés sur le SSD et en utilisant des prédictions de chargement anticipé, la méthode réduit l'utilisation de la mémoire MLX à environ 1,7 Go tout en maintenant des sorties identiques au niveau des octets par rapport à l'implémentation standard de mlx_lm.

Métriques clés de performance sur un MacBook Air M5 de 16 Go :

  • 15,0 tok/s dans les benchmarks contrôlés, soit 72,6 % plus rapide que le streaming direct depuis le SSD.
  • Environ 11,8 tok/s avec d'autres applications en cours d'exécution.
  • Un temps jusqu'au premier token d'environ 2,3 secondes pour des prompts courts.

La technique est conçue pour fonctionner sur les Mac de 8 Go également, bien que les chiffres de performance pour cette configuration restent des estimations basées sur la version actuelle.