著者らは、Speculative Uncertainty (SU) を提示する。これは、ロジット、重み、活性化にアクセスする必要なく、出力トークンのみを分析することで、ブラックボックス LLM エージェントの予測失敗信号を復元する技術である。推測的デコーディングを反転させることで、小さなオープンウェイトのドラフトモデルがエージェントの軌道を単一フォワードパスでスコアリングし、フェーズ認識特徴量を抽出し、検証可能な目的に対してキャリブレーションを行う。

  • SU はルーティングや人間の介入などの下流ポリシーが消費できる失敗確率スコアを生成する。
  • 本手法は Qwen3-Coder-480B および Claude 3.5 Sonnet エージェントの事前実行拒否ゲートとして実装された。
  • デプロイメント結果では、実行エラー率が 6〜8 パーセントポイント、トークンコストが 14〜19% 削減された。
  • このアプローチは再学習なしで分布外ベンチマークに転移し、異なるエージェントモデル間で汎化できる。

この手法により、高コストな実行前に確信のあるエラーを検出し、より効率的で信頼性の高いエージェント型コーディングワークフローを実現できる。