Penulis telah merilis AiiStream Q3.6, sebuah teknik sumber terbuka yang memungkinkan model Qwen3.6-35B-A3B berjalan pada perangkat Apple Silicon dengan hanya 8 hingga 16 GB RAM. Dengan menyimpan ahli yang dialihkan di SSD dan menggunakan prediksi pemuatan awal, metode ini mengurangi penggunaan memori MLX menjadi sekitar 1,7 GB sambil mempertahankan output yang identik tingkat byte dibandingkan implementasi standar mlx_lm.
Metrik kinerja utama pada MacBook Air M5 16 GB:
- 15,0 tok/s dalam benchmark terkontrol, yang 72,6% lebih cepat daripada streaming langsung dari SSD.
- Sekitar 11,8 tok/s dengan aplikasi lain yang sedang berjalan.
- Waktu hingga token pertama sekitar 2,3 detik untuk prompt pendek.
Teknik ini dirancang agar juga berfungsi pada Mac dengan 8 GB, meskipun angka kinerja untuk konfigurasi tersebut masih berupa perkiraan berdasarkan rilis saat ini.