Um usuário lançou o Juud_engine, um fork experimental licenciado sob MIT do Strata v0.1.39 projetado para inferência local do modelo Qwen3.8-Flash-Next em hardware de consumo como a RTX 4090. O projeto introduz duas alterações de decodificação no lado da CPU que podem ser ativadas opcionalmente: redução do tempo de espera dos workers após lotes de especialistas na CPU e omissão da quantização de ativação da CPU para tokens roteados inteiramente para a GPU.
- Os benchmarks em um i7-13700 e RTX 4090 mostraram melhorias na taxa de transferência média de decodificação pareada de 3,1–9,1% e ganhos de latência de 0,5–5,6% em vários comprimentos de contexto.
- Uma execução de controle separada com configurações de cache diferentes relatou ganhos de taxa de transferência mais altos de 9,6–15,6%, embora a consistência da saída tenha variado entre as configurações de teste.
- O repositório inclui diffs do código-fonte, instruções de compilação, hashes dos modelos e um script de verificação para replicação independente.
O autor convida a comentários sobre a metodologia dos benchmarks e solicita replicações independentes para validar as alegações de desempenho.