저자는 AiiStream Q3.6을 출시했으며, 이는 8~16 GB RAM만 있는 Apple Silicon 기기에서 Qwen3.6-35B-A3B 모델을 실행할 수 있게 하는 오픈소스 기술입니다. 라우팅된 전문가를 SSD에 유지하고 조기 로딩 예측을 사용함으로써 이 방법은 MLX 메모리 사용을 약 1.7 GB로 줄이면서 표준 mlx_lm 구현과 바이트 단위로 완전히 동일한 출력을 유지합니다.
16 GB M5 MacBook Air에서의 주요 성능 지표:
- 제어된 벤치마크에서 15.0 tok/s로, SSD 직접 스트리밍보다 72.6% 빠릅니다.
- 다른 애플리케이션이 실행 중일 때 약 11.8 tok/s.
- 짧은 프롬프트의 경우 첫 토큰까지 시간이 약 2.3초입니다.
이 기술은 8 GB Mac에서도 작동하도록 설계되었지만, 해당 구성에 대한 성능 수치는 현재 릴리스를 기반으로 한 추정치입니다.