Les auteurs présentent l'Incertitude Spéculative (SU), une technique qui récupère un signal d'échec prédictif pour les agents LLM à boîte noire en analysant uniquement leurs tokens de sortie, sans nécessiter d'accès aux logits, aux poids ou aux activations. En inversant le décodage spéculatif, un petit modèle de brouillon à poids ouvert évalue la trajectoire de l'agent lors d'un seul passage avant pour extraire des caractéristiques sensibles à la phase et les calibrer par rapport à un objectif vérifiable.
- SU génère un score de probabilité d'échec qui peut être consommé par des politiques en aval telles que le routage ou l'intervention humaine.
- La méthode a été implémentée comme une porte de veto pré-exécution pour les agents Qwen3-Coder-480B et Claude 3.5 Sonnet.
- Les résultats de déploiement montrent une réduction du taux d'erreur d'exécution de 6 à 8 points de pourcentage et des coûts en tokens de 14 à 19 %.
- L'approche se transpose aux benchmarks hors distribution sans réentraînement et se généralise à travers différents modèles d'agents.
Cette méthode permet la détection d'erreurs confiantes avant une exécution coûteuse, rendant les flux de travail de codage agentique plus efficaces et fiables.