Les auteurs présentent l'Incertitude Spéculative (SU), une technique qui récupère un signal d'échec prédictif pour les agents LLM à boîte noire en analysant uniquement leurs tokens de sortie, sans nécessiter d'accès aux logits, aux poids ou aux activations. En inversant le décodage spéculatif, un petit modèle de brouillon à poids ouvert évalue la trajectoire de l'agent lors d'un seul passage avant pour extraire des caractéristiques sensibles à la phase et les calibrer par rapport à un objectif vérifiable.

  • SU génère un score de probabilité d'échec qui peut être consommé par des politiques en aval telles que le routage ou l'intervention humaine.
  • La méthode a été implémentée comme une porte de veto pré-exécution pour les agents Qwen3-Coder-480B et Claude 3.5 Sonnet.
  • Les résultats de déploiement montrent une réduction du taux d'erreur d'exécution de 6 à 8 points de pourcentage et des coûts en tokens de 14 à 19 %.
  • L'approche se transpose aux benchmarks hors distribution sans réentraînement et se généralise à travers différents modèles d'agents.

Cette méthode permet la détection d'erreurs confiantes avant une exécution coûteuse, rendant les flux de travail de codage agentique plus efficaces et fiables.