Janas-LLM est un nouveau C-based, GPL-3.0 inference engine conçu pour exécuter des modèles Mixture-of-Experts plus grands que la RAM sur des machines Linux ordinaires sans GPU en diffusant des experts depuis le SSD.
Le développeur demande des tests communautaires pour ajuster les performances sur diverses configurations matérielles, ciblant spécifiquement les AMD CPUs, les processeurs Intel sans AVX-VNNI, les systèmes avec 16 GB ou moins de mémoire et les SATA SSDs. Le script fourni automatise la construction du engine, le téléchargement des modèles Qwen, la vérification des résultats arithmétiques bit-identical, la mesure de la vitesse sur une machine inerte et le rapport des résultats via GitHub issues.
Cet effort vise à améliorer les self-tuning capabilities du engine pour les threads, l'utilisation du GPU et les stratégies de chargement des experts sur une plus grande variété de matériel que la seule machine de test du développeur.