L'auteur a publié Dev-4B, un petit modèle local basé sur Qwen3-4B-Instruct qui répond aux questions tapées sur des documents avec une confiance calibrée. Il utilise un routeur intégré pour décider s'il faut fournir une réponse rapide ou passer à un raisonnement étape par étape uniquement lorsque la prédiction initiale est probablement erronée.
- Évalué sur 7 100 questions de test figées, Dev-4B a atteint 81,8 % de précision en 1,37 seconde par question.
- Cela dépasse les réponses toujours rapides (76,3 %, 0,16 s/question) et les approches toujours raisonnantes (78,0 %, 10,2 s/question).
- Le modèle utilise un adaptateur LoRA activé pour les questions et un routeur minuscule, avec des builds MLX 8 bits disponibles.
L'outil est conçu pour des expériences locales de calibration et de routage hors ligne, en particulier pour les développeurs indie sur Mac.