作者发布了 Dev-4B,这是一个基于 Qwen3-4B-Instruct 的小型本地模型,能够以校准后的置信度回答关于文档的输入问题。它使用内置路由器决定是提供快速答案,还是仅在初始预测可能错误时升级到逐步推理。

  • 在 7,100 个冻结测试问题上评估,Dev-4B 在每道题 1.37 秒内达到了 81.8% 的准确率。
  • 这优于始终快速的回答(76.3%,0.16 秒/题)和始终推理的方法(78.0%,10.2 秒/题)。
  • 该模型使用针对问题开启的 LoRA 适配器和一个微型路由器,并提供 MLX 8-bit 构建版本。

该工具旨在用于本地校准和离线路由实验,特别是面向 Mac 独立开发者。