Janas-LLM 是一个新的 C-based, GPL-3.0 inference engine,旨在通过在普通 Linux 机器上从 SSD 流式传输专家,在无需 GPU 的情况下运行大于 RAM 的 Mixture-of-Experts 模型。
开发者正在请求社区测试以在各种硬件配置上调整性能,特别针对 AMD CPUs、没有 AVX-VNNI 的 Intel 处理器、内存为 16 GB 或更少的系统以及 SATA SSDs。 提供的脚本自动化了 engine 的构建、Qwen 模型的下载、验证位相同的算术结果、在空闲机器上测量速度,并通过 GitHub issues 报告发现。
这项工作的目标是改进 engine 针对线程、GPU 使用和专家加载策略的 self-tuning capabilities,覆盖比开发者单一测试机器更广泛的硬件。