Des chercheurs ont introduit des « lignes directrices de cohérence » au sein du système ALTK-Evolve, un nouveau mécanisme conçu pour traiter la variabilité des performances des agents LLM que masquent souvent les métriques standard de précision moyenne. En identifiant et stabilisant les points de décision sujets à des inversions, cette approche améliore considérablement la cohérence du succès des tâches sans sacrifier la capacité globale.
- L'Analyseur de Cohérence détecte les étapes « sujettes aux inversions » en rééchantillonnant une seule trajectoire enregistrée avec k=5 complétions, ne nécessitant aucune vérité terrain ni exécution complète de bout en bout.
- Sur le test AppWorld test_normal avec un agent ReAct utilisant GPT-4.1, les lignes directrices de cohérence ont réduit l'écart de cohérence (Mean@5 moins Pass^5) de 24,4 points de pourcentage à 12,0 points de pourcentage.
- Le Pass^5 agrégé est passé de 53,0 % à 69,0 %, tandis que le Mean@5 a légèrement augmenté de 77,4 % à 81,0 %, préservant la précision moyenne.
- La méthode se généralise à des tâches similaires, augmentant le Pass^5 de 13,0 points de pourcentage, et montre des gains transférables sur des modèles plus faibles comme gpt-oss-120b.
Ce travail met en évidence que la cohérence est un axe orthogonal à la capacité, exhortant les développeurs à rapporter le Pass^k aux côtés du Mean@k afin d'évaluer plus précisément la fiabilité des agents dans les environnements de production.