著者はQwen3-4B-Instructに基づく小型のローカルモデルであるDev-4Bをリリースしました。これは、文書に関する入力された質問に較正された信頼度で回答します。初期予測が間違っている可能性が高い場合にのみ、迅速な回答を提供するかステップバイステップの推論にエスカレーションするかを決定するために内蔵ルーターを使用しています。

  • 7,100個の凍結テスト質問で評価した結果、Dev-4Bは質問あたり1.37秒で81.8%の精度を達成しました。
  • これは常に迅速な回答(76.3%、0.16秒/質問)や常に推論するアプローチ(78.0%、10.2秒/質問)を上回ります。
  • モデルは質問に対してオンになるLoRAアダプターと小さなルーターを使用し、MLX 8ビットビルドが利用可能です。

このツールはローカル較正とオフラインルーティング実験のために設計されており、特にMacのインディ開発者向けです。