Janas-LLM は、GPU なしの通常の Linux マシンで RAM より大きな Mixture-of-Experts モデルを実行するために、SSD から experts をストリーミングする新しい C-based、GPL-3.0 inference engine です。
開発者は、AMD CPUs、AVX-VNNI がない Intel プロセッサ、16 GB 以下のメモリを持つシステム、および SATA SSDs に焦点を当てて、多様なハードウェア構成全体でパフォーマンスを調整するためのコミュニティテストを求めています。 提供されたスクリプトは、engine のビルド、Qwen モデルのダウンロード、bit-identical な算術結果の検証、アイドル状態のマシンでの速度測定、および GitHub issues 経由での発見の報告を自動化します。
この取り組みは、開発者の単一のテストマシンよりも幅広いハードウェア全体で、スレッド、GPU 使用率、および expert loading strategies に対する engine の self-tuning capabilities を改善することを目指しています。