El autor ha lanzado AiiStream Q3.6, una técnica de código abierto que permite que el modelo Qwen3.6-35B-A3B se ejecute en dispositivos Apple Silicon con solo 8 a 16 GB de RAM. Al mantener los expertos enrutados en SSD y utilizar predicciones de carga anticipada, el método reduce el uso de memoria de MLX a aproximadamente 1,7 GB mientras mantiene salidas idénticas a nivel de bytes en comparación con la implementación estándar de mlx_lm.

Métricas clave de rendimiento en un MacBook Air M5 de 16 GB:

  • 15,0 tokens/s en pruebas controladas, lo que es un 72,6% más rápido que el streaming directo desde SSD.
  • Aproximadamente 11,8 tokens/s con otras aplicaciones en ejecución.
  • Un tiempo hasta el primer token de alrededor de 2,3 segundos para prompts cortos.

La técnica está diseñada para funcionar también en Macs con 8 GB, aunque las cifras de rendimiento para esa configuración siguen siendo estimaciones basadas en la versión actual.