O autor lançou o Dev-4B, um modelo local pequeno baseado no Qwen3-4B-Instruct que responde a perguntas digitadas sobre documentos com confiança calibrada. Ele usa um roteador integrado para decidir se fornece uma resposta rápida ou escala para raciocínio passo a passo apenas quando a previsão inicial provavelmente está errada.
- Avaliado em 7.100 perguntas de teste congeladas, o Dev-4B atingiu 81,8% de precisão em 1,37 segundos por pergunta.
- Isso supera respostas sempre rápidas (76,3%, 0,16 s/pergunta) e abordagens sempre de raciocínio (78,0%, 10,2 s/pergunta).
- O modelo usa um adaptador LoRA ativado para perguntas e um roteador minúsculo, com compilações MLX de 8 bits disponíveis.
A ferramenta é projetada para experimentos locais de calibração e roteamento offline, especialmente para desenvolvedores indie de Mac.