AgentBench
首个系统性评估大模型作为AI Agent能力的开源基准测试平台,ICLR 2024收录,覆盖8大真实
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个系统性评估大模型作为AI Agent能力的开源基准测试平台,ICLR 2024收录,覆盖8大真实
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
如果你让 GPT-4 帮你订一张明天去上海的机票,它真的能独立完成任务吗?它需要调用工具、读写文件、浏览网页、甚至在数据库里查询信息——这些能力,远不是传统 benchmark 能测出来的。
清华大学 NLP 团队推出的 AgentBench,正是为了回答这个问题。它是第一个系统性地评估大语言模型(LLM)作为智能体(Agent)能力的基准测试平台,被 ICLR 2024 收录。截至目前,项目在 GitHub 上已获得超过 3400 颗星,成为 LLM Agent 领域最具影响力的开源评测工具之一。
传统 NLP 评测(如 MMLU、GSM8K)测试的是模型的答题能力,而 AI Agent 的核心是完成任务——这要求模型具备多轮对话、工具调用、环境交互、长期规划等一系列复合能力。
打个比方:如果把大模型比作一个聪明的大学生,传统 benchmark 考的是期末考试卷,而 AgentBench 考的是「去帮我把下周会议室都订好,顺便发邮件通知大家」这样的真实工作任务。后者显然更能反映一个人在真实职场中的价值。
AgentBench 的出现,填补了 LLM Agent 评测的空白。它不是一套静态题目,而是一套可执行的多任务环境,模型需要在真实场景中与操作系统、数据库、网页等交互来完成评测。
AgentBench 构建了 8 个差异化评测环境,覆盖从底层系统操作到高层逻辑推理的完整能力谱系:
| 评测环境 | 类型 | 描述 |
|---|---|---|
| OS(操作系统) | 真实环境 | Linux 系统命令行操作,包括文件管理、软件安装等 |
| DB(数据库) | 真实环境 | SQL 查询与数据库操作任务 |
| KG(知识图谱) | 真实环境 | 基于 Freebase 的知识推理与 SPARQL 查询 |
| DCG(数字卡牌游戏) | 模拟环境 | 卡牌游戏的策略决策 |
| LTP(横向思维谜题) | 模拟环境 | 需要通过提问逐步缩小答案范围的谜题 |
| ALFWorld | 模拟环境 | 家居任务场景的具身智能测试 |
| WebShop | 模拟环境 | 电商网站购物与导航任务 |
| Mind2Web | 真实环境 | 真实网页浏览与交互任务 |
其中 DCG 和 LTP 由 THUDM 团队原创构建,其余来自已发布的权威数据集。这套环境的巧妙之处在于:既有模拟环境(可控、成本低),也有真实环境(贴近实际、可信度高),两者结合才能给出全面的能力画像。
图1:AgentBench 系统架构 — Client-Server 模式,客户端运行 LLM Agent,服务端托管多任务环境
AgentBench 采用了经典的 Client-Server 架构:
服务端(Server):每个任务环境对应一个独立的 Worker 服务,以 Docker 容器化运行。服务端接收来自客户端的评测请求,执行任务逻辑,验证操作正确性,并返回评分结果。这种隔离设计保证了各任务环境之间的独立性——评测 DB 任务不会干扰 OS 任务。
客户端(Client):Agent.py 是核心调度器,负责读取任务配置(YAML),调用 LLM 生成操作指令,发送 HTTP 请求给服务端,并处理多轮交互的对话历史。Agents/ 目录下则包含了针对不同模型的调用实现(支持 OpenAI、Claude、本地 HuggingFace 模型等)。
配置驱动:start_task.yaml 定义了评测参数(模型、API endpoint、任务列表、超时等),通过 configs.py 解析加载。这种声明式配置让更换评测目标变得极其简单,无需修改代码。
2025年10月,团队推出了 AgentBench FC(Function Calling)版本,基于新框架 AgentRL,将 Agent 的交互方式从自由文本升级为结构化的函数调用。
函数调用模式的优势在于:
FC 版本还引入了完整的 Docker Compose 一键部署,覆盖 alfworld、dbbench、knowledgegraph、os_interaction、webshop 五个任务环境,部署门槛大幅降低。
图2:AgentBench FC(Function Calling)版本的最新评测排行榜
AgentBench 的技术选型非常务实:
| 技术组件 | 用途 |
|---|---|
| FastAPI + Uvicorn | 服务端 HTTP 接口,异步高性能 |
| Pydantic | 请求/响应数据模型验证 |
| transformers + accelerate | 本地 HuggingFace 模型推理加速 |
| fschat | 统一封装多种 LLM API(OpenAI/Anthropic/HuggingFace) |
| docker-py | Python 控制 Docker 容器生命周期 |
| mysql-connector-python | DB 评测任务的 MySQL 连接 |
| SPARQLWrapper + networkx | 知识图谱评测逻辑 |
| aiohttp | 异步 HTTP 客户端(并发评测) |
| numpy + tqdm | 数据处理与进度可视化 |
值得注意的是,评测工具本身不依赖 GPU,推理计算由远程 API 或本地 LLM 引擎完成。评测环境的资源消耗主要来自:Docker 容器(约 2-4GB RAM/容器)、MySQL 实例和 Redis 缓存。
图3:8大评测环境覆盖操作系统、数据库、知识图谱、数字卡牌、横向思维谜题等场景
适合人群:
上手门槛:
非 GUI 工具:AgentBench 是纯命令行工具,没有图形界面。对于只想看评测结果的用户,可以参考官方 Google Sheets Leaderboard。
图4:主流大模型在 AgentBench 上的评测得分排名,GPT-4 领先明显
AgentBench 并非没有批评声音:
AgentBench 的价值,不只在于提供了一套评测工具,更在于它定义了一个重要的研究方向:LLM Agent 的能力该如何系统性地度量和提升?
从 2023 年 AgentBench 论文发表,到 2024 年 VisualAgentBench 的视觉多模态扩展,再到 2025 年 FC 版本的函数调用范式升级,这个项目持续演进,也带动了 MiniWob++、WebArena、OSWorld 等一系列同类基准的出现。
在「大模型落地」的浪潮中,企业和研究机构越来越关注模型在实际任务中的表现,而非单纯追求 benchmark 分数。AgentBench 正是这一趋势的标志性项目之一——它提醒我们:AI 的终点不是答题,而是完成任务。
图5:各评测环境的数据规模统计 — Dev/Test 集规模与多轮交互轮次分布
图6:THUDM 团队发布的 AgentBench 官方封面