Janas-LLM é um novo C-based, GPL-3.0 inference engine projetado para executar modelos Mixture-of-Experts maiores que a RAM em máquinas Linux comuns sem GPUs, transmitindo especialistas do SSD.
O desenvolvedor está solicitando testes da comunidade para ajustar o desempenho em diversas configurações de hardware, especificamente direcionando CPUs AMD, processadores Intel sem AVX-VNNI, sistemas com 16 GB ou menos de memória e SATA SSDs. O script fornecido automatiza a construção do engine, download de modelos Qwen, verificação de resultados aritméticos bit-identical, medição de velocidade em uma máquina ociosa e relato de descobertas via GitHub issues.
Este esforço visa melhorar as self-tuning capabilities do engine para threads, uso de GPU e estratégias de carregamento de especialistas em uma variedade mais ampla de hardware do que a única máquina de teste do desenvolvedor.