Janas-LLM es un nuevo C-based, GPL-3.0 inference engine diseñado para ejecutar modelos Mixture-of-Experts más grandes que la RAM en máquinas Linux ordinarias sin GPUs mediante streaming de expertos desde el SSD.
El desarrollador está solicitando pruebas comunitarias para ajustar el rendimiento en diversas configuraciones de hardware, específicamente apuntando a AMD CPUs, procesadores Intel sin AVX-VNNI, sistemas con 16 GB o menos de memoria y SATA SSDs. El script proporcionado automatiza la construcción del engine, descarga de modelos Qwen, verificación de resultados aritméticos bit-identical, medición de velocidad en una máquina inactiva e informe de hallazgos vía GitHub issues.
Este esfuerzo tiene como objetivo mejorar las self-tuning capabilities del engine para hilos, uso de GPU y estrategias de carga de expertos en una variedad más amplia de hardware que la única máquina de prueba del desarrollador.