CactusはGemma 4 E2Bモデルをポストトレーニングし、各応答に対して0から1の間の信頼度スコアを生成できるようにしました。これにより、開発者は不確実なクエリをより大きなクラウドモデルにルーティングできます。チームは、デコーディング中に中間の隠れ状態を読み取り、エラーの確率を予測する軽量な68kパラメータのプローブ層を追加することでこれを達成しました。
- プローブは12個のホールドアウトベンチマークで平均0.814 AUROCを達成し、0.549のスコアだったトークンエントロピーヒューリスティックを大幅に上回りました。
- クエリの15〜35%のみをGemini 3.1 Flash-Liteにルーティングすることで、ハイブリッドシステムはほとんどのベンチマークでそのモデルのパフォーマンスに追いつきながら、コストを削減しました。
- この手法はモダリティに依存しない正しさの信号を抽出するため、オーディオデータゼロでトレーニングされたにもかかわらず、オーディオベンチマークでも良好なパフォーマンスを発揮します。
- 重みはHuggingFaceで公開されており、Transformers、MLX、Llama.cpp、およびCactus用のコードがMITライセンスの下で提供されています。
このアプローチにより、開発者は信頼度が高い場合はデバイス上の回答を受け入れ、低い場合はクラウドに委譲することで、プライバシーと速度のバランスを精度と合わせて調整できます。