Автор выпустил AiiStream Q3.6, технологию с открытым исходным кодом, которая позволяет модели Qwen3.6-35B-A3B работать на устройствах Apple Silicon с объёмом оперативной памяти всего от 8 до 16 ГБ. За счёт хранения маршрутизируемых экспертов на SSD и использования предсказаний ранней загрузки метод снижает потребление памяти MLX примерно до 1,7 ГБ, сохраняя при этом полностью идентичные результаты по байтам по сравнению со стандартной реализацией mlx_lm.
Ключевые показатели производительности на MacBook Air M5 с 16 ГБ ОЗУ:
- 15,0 токенов/с в контролируемых тестах, что на 72,6% быстрее прямого потокового чтения с SSD.
- Примерно 11,8 токенов/с при работе других приложений.
- Время до первого токена около 2,3 секунды для коротких запросов.
Техника также предназначена для работы на Mac с 8 ГБ ОЗУ, хотя показатели производительности для этой конфигурации остаются оценочными и основаны на текущем релизе.