作者提出了推测不确定性(SU),这是一种通过分析黑盒LLM代理的输出令牌即可恢复预测失败信号的技术,无需访问logits、权重或激活值。通过反转推测解码,一个小型开源权重的草稿模型在一次前向传递中对代理的轨迹进行评分,以提取感知阶段特征并将其与可验证目标进行校准。
- SU生成可供下游策略(如路由或人工干预)使用的失败可能性分数。
- 该方法被实例化为Qwen3-Coder-480B和Claude 3.5 Sonnet代理的前置执行否决门控。
- 部署结果显示,执行错误率降低了6-8个百分点,令牌成本降低了14-19%。
- 该方法无需重新训练即可迁移到分布外基准测试,并在不同代理模型间泛化。
此方法允许在昂贵的执行之前检测自信的错误,从而实现更高效和可靠的代理编码工作流。