Janas-LLM — это новый C-based, GPL-3.0 inference engine, предназначенный для запуска Mixture-of-Experts моделей, превышающих объем RAM, на обычных Linux машинах без GPU путем потоковой передачи экспертов с SSD.
Разработчик просит сообщество протестировать систему для настройки производительности на различных конфигурациях оборудования, в частности, на AMD CPUs, Intel процессорах без AVX-VNNI, системах с 16 GB или менее памяти и SATA SSDs. Предоставленный скрипт автоматизирует сборку engine, загрузку моделей Qwen, проверку битово идентичных результатов арифметики, измерение скорости на простой машине и отчетность через GitHub issues.
Эта работа направлена на улучшение self-tuning capabilities engine для потоков, использования GPU и стратегий загрузки экспертов на более широком спектре оборудования, чем единственный тестовый компьютер разработчика.