ClawProBench
面向 OpenClaw 真实运行时的 LLM Agent 能力评测框架,以 Live-First 理念替代静态数据集刷分
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
面向 OpenClaw 真实运行时的 LLM Agent 能力评测框架,以 Live-First 理念替代静态数据集刷分
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
ClawProBench 是一款以"真实执行(Live-First)"为核心的 LLM Agent 评测工具,专注于在真实的 OpenClaw 运行时环境中评估模型的工具调用、规划、约束处理、错误恢复、综合推理和安全边界能力。与传统的静态数据集评测不同,ClawProBench 让 AI Agent 直接操控真实文件系统、浏览器和工作流,确保评测结果反映实际使用表现,而非对预训练数据的记忆程度。

图1:ClawProBench 项目作者 suyoumo 的 GitHub 头像
传统的 LLM 评测往往基于静态问答数据集(如 MMLU、HellaSwag),这些测试虽然能衡量模型的知识储备,但无法反映 AI Agent 在真实任务中的表现——工具调用是否准确、遇到错误能否恢复、多重约束下能否做出合理决策。
ClawProBench 的诞生正是为了填补这一空白。项目作者 suyoumo(GitHub ID: 39437291)于 2025 年 3 月创建该项目,专注于在 OpenClaw 生态内构建一套透明、可复现、面向真实工作流的 Agent 评测标准。截至 2026 年 6 月,项目已积累 720 Stars、51 Forks,涵盖了 102 个活跃场景 和 162 个总目录场景(其中 60 个处于孵化阶段),形成了目前最完整的 OpenClaw Agent 评测体系。
项目得到 Kimi、Qwen、LongCat、MiMo 等多个国产大模型团队的支持,这些团队为排行榜提供了模型访问资源和评测建议。值得注意的是,项目方明确欢迎国内第三方 API 网关服务商将 Claude 4.7 Opus 或 GPT-5.5 等模型纳入评测,这显示了作者推动透明评测的开放态度。
ClawProBench 的评测框架围绕 六大能力维度 构建,每个维度对应 Agent 在实际部署中的关键能力:
| 维度 | 权重 | 含义 |
|---|---|---|
| 工具调用(Tool Use) | 20% | Agent 调用工具的准确性、组合逻辑和效率 |
| 规划(Planning) | 20% | 多步骤任务的拆解与依赖管理能力 |
| 约束处理(Constraints) | 15% | 在多重规则限制下完成任务的能力 |
| 错误恢复(Error Recovery) | 15% | 遇到异常时诊断、恢复和降级的能力 |
| 综合推理(Synthesis) | 15% | 多源信息融合、因果推理的能力 |
| 安全边界(Safety) | 15% | 拒绝有害请求、保护隐私数据的能力 |
难度等级划分为四级:Easy → Medium → Hard → Expert,权重倍率从 1.0 到 8.0 递增,确保评测既能覆盖基础场景又不忽视高难度挑战。
评测支持两套执行模式:Live 模式(真实 OpenClaw 运行时)和 Replay 模式(基于历史 trace 回放),其中 Live 模式又分为 workspace_live(独立工作区)和 openclaw_native(直接调用 OpenClaw CLI)两种子模式。默认使用 Live 模式,通过 python3 run.py run --scenario <id> 启动。
从代码结构看,ClawProBench 的核心引擎位于 harness/ 目录,采用高度模块化设计:
models.py — 定义所有数据模型(Scenario、CheckSpec、BenchmarkResult 等),使用 Python dataclass + Enum 确保类型安全,六大维度定义在此runner.py — 场景执行编排器,处理并发执行(ThreadPoolExecutor)、结果聚合、超时管理和错误处理live_harness.py — Live 模式核心,启动 OpenClaw Gateway、等待就绪、执行 agent run、收集 trace,核心逻辑在 _run_openclaw_live() 方法scoring.py — 确定性评分引擎,支持 19 种 check 类型(tool_called、file_exists、response_contains 等),通过 grade_scenario() 计算最终分数benchmark_profiles.py — 预定义评测配置,core(26 个核心场景)、intelligence(完整智能评测)、coverage(广覆盖回归测试)、full(全部场景)reporter.py — 报告生成,支持 JSON 和 Markdown 格式,输出结构化分数和维度分布场景定义使用 YAML 文件(scenarios/ 目录),每个场景包含任务描述、输入条件、评分规则和 fixture 依赖。例如 constraints_07_hidden_constraints_live.yaml 描述一个需要 Agent 识别隐藏约束并遵守的场景,其 fixture 包含模拟日志和系统代码文件。
评分体系采用 19 种 check 类型的组合:工具调用验证(tool_called、tool_sequence、tool_arg_contains)、文件操作验证(file_exists、file_contains)、响应内容验证(response_contains、response_excludes)、过程验证(audit_state_match)等。每种 check 独立赋分,最终加权汇总。
项目包含 162 个场景,分为 6 大类:
其中 oib5/ 子目录下的 28 个场景(t01-t28)是一个完整项目开发评测链,覆盖从文件提取到全栈项目的完整开发流程,是项目中最具挑战性的综合测试。
ClawProBench 的使用流程非常简洁:
# 安装依赖
pip install -r requirements.txt
# 查看可用场景
python3 run.py inventory --json
# 运行默认 core 配置(26 个核心场景)
python3 run.py run
# 运行特定场景
python3 run.py run --scenario constraints_03_exact_format_live
# 生成报告
python3 run.py report
结果以 JSON/Markdown 格式输出,包含各维度得分、工具调用链、trace 日志。公开排行榜(suyoumo.github.io/bench)展示了各模型在 core 配置下的排名,所有评测结果可复现。
ClawProBench 的设计哲学决定了它的局限性:强依赖 OpenClaw 运行时。运行评测需要本地安装 openclaw CLI 和 Gateway(默认端口 18790),配置文件 config/openclaw.json.template 指定了模型(如 anthropic/claude-sonnet-4)和工作区根目录。这意味着评测结果受 OpenClaw 版本和配置影响,跨平台复现存在一定门槛。
此外,Live 模式下每次评测都需要启动 OpenClaw Gateway,对网络和硬件资源有一定要求。排行榜上覆盖的模型主要来自 Kimi、Qwen、LongCat、MiMo 等国产团队,Claude 和 GPT 模型需要通过第三方 API 网关访问。
ClawProBench 的核心价值在于透明性和真实性。项目完全开源(Apache-2.0),所有评测场景、评分规则和执行 trace 均可审计,拒绝黑盒评分。作者还同步维护了 LLMLeadBoard——一个聚合公开模型报告的榜单,目前已收录 63 个模型、55 份报告、444 个 benchmark,支持跨报告分数对比和趋势分析。
在 AI Agent 能力快速演进的当下,ClawProBench 提供了一套可靠的"能力刻度尺",让研究者和开发者能够客观衡量不同模型在真实 Agent 工作负载下的表现差异,而非被静态 benchmark 的高分所迷惑。
本报告基于 ClawProBench v1.0(GitHub: suyoumo/ClawProBench,Stars: 720)生成,数据采集时间:2026-06-18。