ai-agent-benchmark-compendium
覆盖 50+ 主流 AI Agent 评测基准的精选索引,按函数调用/推理/代码/GUI 四大维度分类整理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
覆盖 50+ 主流 AI Agent 评测基准的精选索引,按函数调用/推理/代码/GUI 四大维度分类整理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否有这样的困惑:想评估自己的 AI Agent 到底「有几斤几两」,却发现市面上的评测标准五花八门、无从下手?BFCL 测函数调用、SWE-bench 测代码修复、WebArena 测网页操作……每个 benchmark 各说各话,根本没法横向比较。这个痛点,正是 philschmid/ai-agent-benchmark-compendium 诞生的背景。
随着 GPT-4、Claude 3.5、Gemini 等大模型相继具备 Agent 能力(调用工具、自动化执行、多步推理),如何科学地评估 Agent 的综合实力,成了研究圈和工业界的共同难题。不同的评测基准侧重点差异巨大:一个擅长工具调用的模型,未必能在代码修复任务上表现同样出色;而擅长代码的模型,又可能在真实浏览器操作中「两眼一抹黑」。没有一个统一框架,研究者选 benchmark 全凭经验,论文里的评测结果也因此难以直接比较。
正是在这样的背景下,知名 AI 布道师 Philipp Schmid(前 Hugging Face 技术 Lead、AWS ML Hero,现 Google DeepMind AI 开发者体验负责人)决定出手,编写了这份 AI Agent 评测基准的精选合集。Philipp 在 AI 社区拥有近 4000 名追随者,他的博客 philschmid.de 在 NLP/ML 圈有相当影响力,由他来牵头做这件事,具备天然的权威性和传播力。
AI Agent Benchmark Compendium 的本质是一个 精选索引库,目前收录了超过 50 个主流 AI Agent 评测基准,并按四大能力维度分类组织:
| 维度 | 代表 benchmark | 核测能力 |
|---|---|---|
| 函数调用 & 工具使用 | BFCL、ToolBench、τ-Bench、xLAM | Agent 调用外部 API/函数的能力 |
| 通用助手 & 推理 | GAIA、AgentBench、LiveBench、HLE | 综合推理、多模态、工具协同 |
| 代码 & 软件工程 | SWE-bench、SWE-bench Verified、LiveCodeBench | AI 修复真实 GitHub Issue |
| 计算机交互(GUI/Web) | WebArena、OSWorld、WebVoyager、Mind2Web | 真实浏览器/OS 环境操作 |
每个 benchmark 条目都包含:论文链接、GitHub 仓库、Leaderboard 排行榜地址、数据集下载地址,真正做到「一站式」信息聚合。
这份合集并非简单罗列,而是精挑细选了各领域最有代表性的评测标准。以几个重头戏为例:
SWE-bench(软件工程维度):来自 UC Berkeley 和 MIT 的联合研究成果,从真实 GitHub 仓库中提取 2294 个 Issue,要求 AI Agent 生成能解决问题的代码补丁。这是目前代码修复领域最具影响力的基准,在 2023-2024 年间被 OpenAI、Anthropic、Meta 等公司的论文广泛引用。
WebArena(网页交互维度):一个自托管的网页评测环境,模拟了真实网站功能(电商、社交、地图等),要求 Agent 在多步骤操作中完成复杂指令。不同于依赖 HTML 解析的方案,WebArena 构建了完整的功能性模拟网站,保证了评测的公平性和可复现性。
τ-Bench(tau-bench):由 Sierra Research 出品,模拟真实客户支持场景——电商和航空退票。Agent 必须在严格遵守业务规则的前提下,与模拟用户动态对话,最终解决问题。这个 benchmark 的独特之处在于它同时测了「工具调用」和「对话策略」,填补了纯工具调用评测的空白。
OSWorld(操作系统维度):首个在真实操作系统(Windows/macOS/Ubuntu)中评测多模态 Agent 的基准,包含 369 个真实任务。相比纯模拟器方案,OSWorld 直接跑在真实系统上,难度和真实性都更高,是当前 GUI Agent 评测的天花板之一。
这是一个纯 Markdown 文档库,不需要安装任何依赖。使用方法非常简单:
git clone https://github.com/philschmid/ai-agent-benchmark-compendium
cd ai-agent-benchmark-compendium
cat README.md # 直接阅读
对于想深入了解某个 benchmark 的读者,每个条目都附带了指向论文、GitHub 仓库和 Leaderboard 的完整链接,可以直接跳转到对应页面查看更详细的技术报告和评测结果。对于想系统研究 Agent 评测领域的开发者,这个仓库也是一个很好的「起点地图」,帮助你快速建立对整个领域格局的认知。
必须承认,这份合集也有其局限性。首先,这是一个静态文档库,没有任何自动化工具来持续跟踪这些 benchmark 的更新——排行榜随时在变化,仓库本身不会主动同步。其次,合集按 4 大维度分类,但现实中的 Agent 任务往往是跨维度的复合任务,比如一个代码修复 Agent 同时需要工具调用(Searc hAPI)和代码执行能力,单纯看某个维度的分数无法反映真实水平。
此外,对于 agent 评测本身,学术界也有争议:一些研究者认为现有 benchmark 都存在「数据泄露」风险——模型可能在预训练阶段就见过测试集,从而虚高了评测分数。LiveBench 和 HLE(Humanity's Last Exam)正是在这一批评下诞生的「抗污染」评测,试图通过定期更新题目和引入专家级难题来缓解这一问题。
从趋势上看,AI Agent 是 2024-2025 年最热门的方向之一,而这个仓库恰好填补了一个关键空白:没有一份统一视图来覆盖所有主流评测基准。在 Agent 能力快速迭代的当下,这份合集对于研究者的意义,类似于「地图」之于探险家——它不能替代实地考察,但能让你知道该往哪儿走。
随着多模态 Agent、具身智能、Web Agent 等新方向的快速发展,这份合集的覆盖范围预计会持续扩展。作者在 README 中明确欢迎 PR 和 Issue,保持开放共建的态度。