Agent Waste Index 对来自11个公共数据集中的341,054条智能体轨迹进行了评分,以识别循环、盲目重试、工具输出过大以及放弃运行等低效问题。分析显示,Llama 智能体等较弱模型中普遍存在循环和重试行为,而在 Claude 3.7 Sonnet 和 Qwen3-Coder-480B 中则较为罕见。

  • 工具输出大小因框架而异,OpenHands 和 SWE-agent 在超过一半的运行中携带了超过2万个字符的观察结果。
  • 按步骤数计算的最长五分之一运行消耗了预估支出的40%,但其解决率低于最短五分之一运行。
  • 该项目提供了从 hub 重建 Index 的管道和检测器,在线表格可供社区验证。

作者为数据集发布者提供了修正机制,旨在提高编码智能体性能的透明度。