ClawBench
首个在真实144个网站上系统性评测AI浏览器智能体日常任务完成率的开源基准
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个在真实144个网站上系统性评测AI浏览器智能体日常任务完成率的开源基准
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
场景切入: 想象你让 AI 帮你在某外卖 App 上点一份黄焖鸡米饭。AI 需要依次完成:打开浏览器 → 搜索商家 → 选择菜品 → 填写地址 → 提交订单。现实是,即使目前最强的 AI 模型,这一连串操作的成功率也只有约 33%。ClawBench 就是专门测量这个"33%"的开源基准。
2024 年,Claude Computer Use、OpenAI Operator 等浏览器 AI 产品相继发布,但业界缺乏统一的评测标准。多数现有评测依赖静态页面截图或模拟环境,无法真实反映 AI 在动态、登录态、反爬机制下的表现。TIGER-AI-Lab(浙江大学 NAIL Group)于 2025 年 4 月发布 ClawBench,填补了「真实网站 AI 浏览器智能体」评测的空白。
ClawBench 定位为 AI Agent Harness Benchmark,强调三个正交维度:任务(不同的真实网站任务)、模型(不同的基础大模型)、Harness(不同的 Agent 执行框架)。配合姊妹项目 HarnessBench(固定模型、变化 Harness),形成完整的四象限评测矩阵。
| 版本 | 任务数 | 网站数 | 场景类别 |
|---|---|---|---|
| V1 | 153 | 144 | 15 类日常场景 |
| V2 | 130 | — | 更高难度长流程任务 |
测试场景覆盖:外卖点餐、酒店预订、航班查找、简历投递、邮件管理、购物评论、社交发帖等。V2 于 2026 年 5 月升级为默认测试集,引入宽松评分机制。
ClawBench 的执行架构由三大部分组成:Harness(被测 Agent)通过 Chrome 浏览器操作真实网站,浏览器内的请求拦截器(Request Interceptor)捕获关键操作,最终在 Docker 隔离容器中完成评测。代码目录结构清晰分层:
src/clawbench/runner/ — 核心运行逻辑(run.py、batch.py、judge.py)src/clawbench/runtime/harnesses/ — 各 Agent Harness 适配(browser-use、claude-code、opencode、hermes、openclaw 等 15 种)src/clawbench/runtime/runtime-server/ — 运行时服务端eval/ — 评分模块(rescore.py、reproduce.py)test-cases/v1/ 和 test-cases/v2/ — 任务定义(YAML + rubric)每个测试任务的执行全程被记录为 5 层数据:视频层(完整操作录像)、截图层(关键步骤截图)、网络请求层(所有 HTTP 请求日志)、浏览器动作层(DOM 操作序列)、思考日志层(AI 推理过程日志)。这些数据通过 HuggingFace 数据集公开(V1 Trace 和 V2 Trace),任何人都可以离线复现评分结果。
评分分为两个阶段。Stage 1 — 请求拦截:任务定义中包含 eval_schema,规定期望拦截的最终 HTTP 请求格式(URL 正则 + HTTP 方法)。AI Agent 完成任务后,系统拦截其发出的最后一个符合格式的请求。Stage 2 — LLM 裁判:将任务指令和拦截的请求体一起发给裁判模型,判断该请求是否真正完成了用户要求。裁判 prompt 极度严格,只要请求目的有偏差即判失败。最终得分 = 拦截率 × 裁判匹配率。评分逻辑代码位于 src/clawbench/runner/judge.py,裁判系统提示词内置了 6 条严格判定规则。
ClawBench 的核心创新是 Harness 抽象层。不同 Agent 产品有不同的 API 协议和运行方式,Harness 层将差异抹平,提供统一的执行接口。支持 browser-use、claude-code、opencode、hermes、openclaw、pi、claw-code 等 15 种 Harness。每个 Harness 有独立的 usage-emitter.py 记录调用量和 token 消耗。Harness 注册表在 harness_registry.py 中以插件形式管理,新增 Harness 只需实现标准接口。
src/clawbench/tui.py 基于 questionary + rich 构建交互式命令行界面,支持模型选择、测试用例筛选、批量运行、结果展示。入口点 clawbench 命令行工具直接启动 TUI 交互。
pip install clawbench-eval
clawbench # 启动 TUI 交互界面
或克隆源码快速启动:git clone https://github.com/reacher-z/ClawBench.git && cd ClawBench && ./run.sh
models.yaml 配置)核心 Python 依赖:fpdf2、huggingface_hub、pyyaml、questionary、rich。开发依赖包含 pytest、ruff、pyright。pyproject.toml 使用 hatchling 构建系统。
项目提供 .devcontainer(VSCode Remote Container)配置,开发者可一键进入容器化开发环境。测试用例和评分标准以 YAML 格式定义在 test-cases/ 目录下,扩展性强。整体部署难度为「中等」,需同时配置 Python 环境 + Docker + 模型 API。
即使最强的大模型组合(GLM-5.1/Hermes),V2 测试集中 reward 也仅约 18.5%,说明 AI 浏览器智能体距离可靠替代人类日常上网操作还有相当距离。各主流模型评测结果可在 HuggingFace Live Leaderboard 实时查看。
ClawBench 的出现标志着 AI Agent 评测从「静态问答」向「动态任务执行」的范式转移。它不仅提供了量化指标,更通过公开的 5 层录制数据,为研究者提供了可复现的实验基底。目前已被 awesome-harness-engineering、Awesome-AI-Agents、awesome-computer-use 等多个优质列表收录,arXiv 论文(2604.08523)曾获 HuggingFace 每日第三热门论文。
| 维度 | 技术选型 |
|---|---|
| 主语言 | Python(>=3.11) |
| 构建工具 | Hatchling |
| 交互界面 | questionary + rich |
| 容器隔离 | Docker |
| 模型调用 | OpenAI / Anthropic / GLM API |
| 数据托管 | HuggingFace Datasets |
| 文档 | 多语言(英文 + 中文) |
| 许可证 | Apache-2.0 |
代码质量方面,项目使用 ruff 做代码检查、pyright 做类型检查、pytest 做单元测试,pre-commit hooks 自动化 CI。文档结构完善,社区贡献流程清晰。