O autor lançou o AiiStream Q3.6, uma técnica de código aberto que permite que o modelo Qwen3.6-35B-A3B seja executado em dispositivos Apple Silicon com apenas 8 a 16 GB de RAM. Ao manter os especialistas roteados no SSD e usar previsões de carregamento antecipado, o método reduz o uso de memória do MLX para aproximadamente 1,7 GB, mantendo saídas idênticas ao nível de bytes em comparação com a implementação padrão do mlx_lm.
Principais métricas de desempenho em um MacBook Air M5 com 16 GB:
- 15,0 tokens/s em benchmarks controlados, o que é 72,6% mais rápido que o streaming direto do SSD.
- Aproximadamente 11,8 tokens/s com outros aplicativos em execução.
- Um tempo até o primeiro token de cerca de 2,3 segundos para prompts curtos.
A técnica foi projetada para funcionar também em Macs com 8 GB, embora as cifras de desempenho para essa configuração permaneçam estimativas baseadas no lançamento atual.