Un usuario ha publicado Juud_engine, una bifurcación experimental con licencia MIT de Strata v0.1.39 diseñada para inferencia local del modelo Qwen3.8-Flash-Next en hardware de consumo como la RTX 4090. El proyecto introduce dos cambios de descodificación en CPU opcionales: reducción del tiempo de espera del trabajador tras los lotes de expertos en CPU y omisión de la cuantización de activaciones en CPU para tokens dirigidos exclusivamente a la GPU.
- Las pruebas en un i7-13700 y RTX 4090 mostraron mejoras medianas en el rendimiento de descodificación emparejado del 3.1–9.1% y reducciones de latencia del 0.5–5.6% en varias longitudes de contexto.
- Una ejecución de control separada con diferentes configuraciones de caché reportó mayores ganancias de rendimiento del 9.6–15.6%, aunque la consistencia de la salida varió entre las configuraciones de prueba.
- El repositorio incluye diferencias de código fuente, instrucciones de compilación, hashes del modelo y un script de verificación para replicación independiente.
El autor invita a comentarios sobre la metodología de las pruebas y solicita replicaciones independientes para validar las afirmaciones de rendimiento.