Benchmark · agentic

AgentBench

0 条结果 0 个模型

AgentBench 将 LLM 作为交互式智能体进行评测,覆盖 8 个不同环境(代码、游戏和网页任务),衡量多轮决策能力;每个环境给出各自的分数,再汇总为单一的加权 Overall Score。

了解更多
示例
「操作系统」环境的任务:给智能体一个自然语言目标(例如统计满足某条件的文件数量,或修改某文件的权限),它逐轮输入 bash 命令、读取每次的输出,然后提交最终答案,或让 shell 处于所要求的状态。
评分方式
每个环境使用各自的指标——成功率(OS、DB、House-Holding)、F1(知识图谱)、平均奖励(Web Shopping)、步骤/元素准确率(网页浏览),或游戏进度/奖励(卡牌游戏、谜题)。主指标 Overall Score 是八个环境分数的加权平均,权重经过设定以平衡各任务难度,使任何一个简单任务都不会占主导。
验证方式
每个任务都在可执行环境中运行,并由自动、确定性的检查器判定:智能体的多轮轨迹通过程序验证(例如 shell 检查脚本、数据库最终状态、WebShop 奖励,或与标准动作的匹配)。没有人工评判;交互设有最大轮数上限,超出上限或输出非法动作均记为失败。
为何重要
它是最早将 LLM 作为智能体(而非单轮回答者)来评测的标准化基准之一,考察长时程推理、工具使用和错误恢复;它揭示了顶级商用 API 模型与开源模型在真实智能体任务上的巨大差距。
示例解析
任务
「操作系统」环境。在 Ubuntu 的 bash shell 中,智能体被告知:「本系统中有多少个用户账户以 /bin/bash 作为登录 shell?给出数字。」在作答前,它可以分多轮执行若干 shell 命令。
解答
grep -c ':/bin/bash$' /etc/passwd
解析
/etc/passwd 每一行以冒号分隔的第 7 个字段是登录 shell,因此统计以 :/bin/bash 结尾的行数即为使用 bash 登录的账户数;智能体从命令输出中读取该数字,并通过环境的 answer(N) 动作返回。评分:OS 检查器运行验证脚本,将提交判为二元的成功/失败。

该 benchmark 暂无已验证的得分。