skill
AI编程智能体Benchmark系统,用53个真实任务衡量LLM在OpenClaw框架下的工具调用和
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI编程智能体Benchmark系统,用53个真实任务衡量LLM在OpenClaw框架下的工具调用和
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你是一名 AI 工程师,手头有五六款大语言模型,都号称"编程能力很强"。你让它们分别去完成一个真实的代码任务——比如根据一份会议纪要生成待办事项,或者修复一个 CI 构建失败的问题——结果很可能让你大跌眼镜:有的模型连工具参数都填错,有的在多步骤操作中途迷路,还有的把任务完成得驴唇不对马嘴。这就是 PinchBench 想要解决的问题。
PinchBench 是由 kilo.ai 团队开发的开源基准测试系统,专门用来衡量 LLM(大语言模型)作为 OpenClaw 编程智能体时的真实表现。它不考"单独知识点",而是把真实任务丢给 AI,看它能不能把事情做对、做完整。

图1:PinchBench Logo,🦀 代表该项目使用 Rust 语言构建核心基础设施
传统的 LLM 评测往往聚焦于"答对题"——出一道数学题、回答一个历史问题,看输出对不对。但这套逻辑对 AI 编程智能体完全不适用。编程智能体需要的是:
PinchBench 的核心理念是:用真实任务替代合成测试。53 个任务覆盖日程管理、股票查询、邮件撰写、代码编写、日志分析、PDF 总结等真实工作场景,每一项都需要 AI 智能体真正与外界环境交互、产生可验证的实际成果。

图2:任务资源示例——包含真实会议记录、CSV 数据、日志文件等丰富的测试素材
PinchBench 的技术架构分为两层:
1. OpenClaw 智能体层(Agent)
OpenClaw 是整个系统的"AI 执行者"。当 PinchBench 将一个任务(如"分析这份销售数据并生成报告")交给 OpenClaw 后,OpenClaw 会:
代码 scripts/lib_agent.py 中实现了完整的 Agent 执行框架,包括:
paramiko 连接远程 Agent,支持跨机器评测2. PinchBench 评测引擎层(Grading)
任务完成后,scripts/lib_grading.py 负责评判结果质量。评分策略包括:
PinchBench 将 53 个任务组织在 tasks/ 目录下,按领域分为:
| 类别 | 任务数 | 代表任务 | 考察能力 |
|---|---|---|---|
| Productivity | 5+ | 日历事件创建、时间解析 | 工具调用、时间语义理解 |
| Research | 8+ | 股票价格、会议调研、市场研究 | Web 搜索、数据提取 |
| Writing | 4+ | 博客文章、邮件撰写、人性化改写 | 内容生成、语气风格控制 |
| Coding | 4+ | 天气脚本、文件结构创建 | 代码生成、文件操作 |
| Analysis | 20+ | CSV 分析、日志异常检测、PDF 总结 | 数据处理、结构化推理 |
| 5+ | 邮件分类、搜索、起草回复 | 信息检索、格式规范 | |
| Skills | 3+ | 技能搜索、ClawHub 交互 | 工具发现、多智能体协作 |
以 task_csv_life_exp_outliers.md(预期寿命异常值检测)为例,任务要求 AI:
assets/csvs/ 下的 GDP 与预期寿命 CSV 数据整个任务链需要 AI 自主完成:数据理解 → 算法选择 → 代码编写 → 可视化生成 → 报告撰写,完整考察了 AI 编程智能体的端到端能力。
assets/ 目录提供了丰富的真实世界测试数据:
这套资产库的规模(超过 14MB 的 PDF、百万行日志数据)体现了 PinchBench 追求"真实感"的评测理念。
# 克隆项目
git clone https://github.com/pinchbench/skill.git
cd skill
# 安装依赖(使用 uv 包管理器)
uv sync
# 运行基准测试(以 Claude Sonnet 4 为例)
./scripts/run.sh --model anthropic/claude-sonnet-4
# 运行特定任务套件(更快)
./scripts/run.sh --model openai/gpt-4o --suite task_calendar,task_stock
前置要求:Python 3.10+、uv 包管理器、一个运行中的 OpenClaw 实例。
项目提供了 Dockerfile.benchmark,基于 node:22-bookworm,预装了:
适合在 CI 环境中批量运行基准测试,保证环境一致性。

图3:日志分析任务——AI 需要从海量日志中定位异常模式
PinchBench 并非完美,它的设计选择也引发了一些讨论:
1. 依赖 OpenClaw 平台
评测的是"LLM + OpenClaw"这一组合的智能体能力,而非纯 LLM 的编码能力。这意味着结果同时受到 LLM 本身能力和 OpenClaw 框架能力的双重影响。换用其他 Agent 框架(如 LangChain Agent、CrewAI),结果可能完全不同。
2. 模型 API 路由依赖 OpenRouter
默认通过 OpenRouter 路由请求,虽然支持自定义 provider,但配置成本不低。如果你的组织有特定的 LLM API 直连需求,可能需要修改 lib_agent.py 中的模型调用逻辑。
3. 评测的主观性
虽然有自动化评分机制,但某些任务(博客文章质量、邮件语气是否合适)的评分不可避免地带有主观性。官方也承认官方排行榜的结果需要手动配置 default-models.yml 提交。
4. 任务覆盖仍有盲区
53 个任务集中在数据处理和办公场景,对更复杂的系统编程(并发、分布式调试)、安全渗透测试、实时系统交互等场景覆盖不足。
PinchBench 的出现反映了 AI 领域的一个深刻趋势:从"考知识"到"考行动"的评测范式转变。
传统的 MMLU、GSM8K 等 benchmark 测试的是 LLM 的知识储备和解题能力,但在实际应用中,用户更关心的是"AI 能不能帮我把事情搞定"。Agent 基准测试(如 PinchBench、GAIA、AgentBench)正在成为新一代 LLM 评测的主流范式。
从 GitHub 数据看,PinchBench 获得了 1230 颗星,53 个任务覆盖了 6 大真实场景类别,且项目维护活跃(近期持续更新任务数量和 CI 工作流)。这说明市场对"真实任务评测"的需求正在快速增长。
增长亮点:
automated-only 模式,方便快速迭代评测PinchBench 是一款专注于 AI 编程智能体评测的开源工具,由 kilo.ai 团队开发。它通过 53 个真实世界任务(日历、邮件、代码、日志、CSV 分析等)来衡量 LLM 在 OpenClaw 智能体框架下的实际表现,填补了传统 benchmark 缺乏"行动能力"评测的空白。
适合谁使用:
部署难度:⭐⭐(2/5)—— 纯 CLI 工具,通过 uv 一键安装,无 Web UI,适合技术团队集成到 CI/CD 流程中。
硬件需求:无需 GPU,普通开发机(2GB RAM、1GB 磁盘)即可运行。真正的计算负载在 LLM API 端,不在本地。
推荐尝试路径:从 task_sanity 开始验证环境 → 运行 automated-only 套件快速体验 → 对比不同模型的评分结果 → 提交到官方排行榜。