Un utilisateur a publié Juud_engine, un fork expérimental sous licence MIT de Strata v0.1.39 conçu pour l'inférence locale du modèle Qwen3.8-Flash-Next sur du matériel grand public comme la RTX 4090. Le projet introduit deux modifications de décodage côté CPU optionnelles : réduction du temps d'attente des travailleurs après les lots d'experts CPU et saut de la quantification des activations CPU pour les tokens routés entièrement vers le GPU.

  • Les benchmarks sur un i7-13700 et une RTX 4090 ont montré des améliorations médianes du débit de décodage apparié de 3,1 à 9,1 % et des gains de latence de 0,5 à 5,6 % sur différentes longueurs de contexte.
  • Une course de contrôle séparée avec des paramètres de cache différents a signalé des gains de débit plus élevés de 9,6 à 15,6 %, bien que la cohérence des sorties varie entre les configurations de test.
  • Le dépôt inclut les diffs source, les instructions de construction, les hachages de modèles et un script de vérification pour une réplication indépendante.

L'auteur invite aux commentaires sur la méthodologie des benchmarks et demande des réplications indépendantes pour valider les affirmations de performance.