研究者たちは、LLMエージェントのパフォーマンスにおけるばらつきを標準的な平均精度指標がしばしば隠蔽する問題を解決するために設計された新しい仕組みであるALTK-Evolveシステム内に「整合性ガイドライン」を導入した。反転しやすい意思決定ポイントを特定して安定化させることで、このアプローチは全体の能力を犠牲にすることなく、タスク成功の整合性を大幅に改善する。
- 整合性アナライザーは、1つの記録された軌跡をk=5回の完了で再サンプリングすることで「反転しやすい」ステップを検出し、正解やエンドツーエンドの再実行を必要としない。
- GPT-4.1を使用するReActエージェントによるAppWorld test_normalにおいて、整合性ガイドラインは整合性ギャップ(Mean@5からPass^5を引いた値)を24.4パーセントポイントから12.0パーセントポイントに削減した。
- 集計されたPass^5は53.0%から69.0%に増加し、Mean@5も77.4%から81.0%にわずかに上昇し、平均精度を維持した。
- この手法は類似タスクに一般化し、Pass^5を13.0パーセントポイント引き上げ、gpt-oss-120bのような弱いモデルでも転移可能な改善を示す。
本研究は、整合性が能力とは直交する軸であることを浮き彫りにし、開発者に生産環境におけるエージェントの信頼性をより適切に評価するためにMean@kとともにPass^kを報告するよう促している。