El autor lanzó Dev-4B, un modelo local pequeño basado en Qwen3-4B-Instruct que responde preguntas escritas sobre documentos con confianza calibrada. Utiliza un enrutador integrado para decidir si proporcionar una respuesta rápida o escalar a razonamiento paso a paso solo cuando la predicción inicial es probablemente incorrecta.
- Evaluado en 7,100 preguntas de prueba congeladas, Dev-4B logró 81.8% de precisión en 1.37 segundos por pregunta.
- Esto supera las respuestas siempre rápidas (76.3%, 0.16 s/preg) y los enfoques siempre de razonamiento (78.0%, 10.2 s/preg).
- El modelo utiliza un adaptador LoRA activado para preguntas y un enrutador diminuto, con compilaciones MLX de 8 bits disponibles.
La herramienta está diseñada para experimentos locales de calibración y enrutamiento fuera de línea, particularmente para desarrolladores independientes de Mac.