awesome-harness-engineering
AI Agent 驾驭工程全链路资源导航,收录 355+ 优质资源覆盖 Harness 设计全流程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI Agent 驾驭工程全链路资源导航,收录 355+ 优质资源覆盖 Harness 设计全流程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Awesome Harness Engineering 项目封面 Banner
你可能有过这样的经历:花大价钱买了一个功能强大的 AI 编程助手,却在团队里推广时举步维艰——上下文窗口不够用、工具调用频繁报错、Agent 记忆混乱、长任务中途迷失方向。这些问题,99% 并不来自模型本身,而来自**驾驭框架(Harness)**的设计质量。
Awesome Harness Engineering 正是来解决这个问题的。这是一个由独立开发者 ai-boost 维护的精选资源列表(Awesome List),专门收录 AI Agent 驾驭工程领域的核心工具、设计模式、评测方法和最佳实践。截至 2026 年 6 月,仓库已收录 355+ 条优质资源,涵盖从基础理论到生产级部署的全链路内容,在 GitHub 上已获得 1789 颗星,成为该领域增长最快的导航性项目之一。
在展开具体资源之前,有必要先理解这个列表的核心概念——Harness Engineering。
这个词最早由 OpenAI 在 2025 年提出,用来描述为 AI Agent 设计支撑架构的学科。如果说 AI 模型是汽车引擎,那么 Harness 就是整辆汽车的底盘、悬挂、方向盘和仪表盘——它决定了车辆能否在真实路况下稳定行驶。OpenAI 在其官方博客中将 Harness Engineering 定义为:
设计围绕 AI Agent 的脚手架(scaffolding):上下文传递、工具接口、规划产物、验证循环、记忆系统和沙箱环境——这些组件共同决定了 Agent 在真实任务中的成败。
一个好的 Harness 能让普通模型在复杂任务上表现出色,而一个糟糕的 Harness 则能让最强模型彻底失效。这个列表所做的,就是把全球开发者在这个领域的经验结晶系统化整理,让后来者不必从零摸索。
该仓库创建于 2026 年 3 月 29 日,距今不足三个月,但增长极为迅猛——177 个 Fork、53 个开放 Issue、持续高频更新。维护者 ai-boost 同时也是 awesome-gpts(GPT 应用精选列表)的作者,在 AI 资源整理领域有一定积累。
从内容组织方式来看,该列表深受 OpenAI 工程博客和 Anthropic 工程团队的理念影响,大量引用了 OpenAI 关于 Codex Agent Loop 的深度解析、Anthropic 关于 Agent 架构和工具设计的工程实践。这使得列表的学术深度和技术权威性都有保障,而非泛泛收录各类工具。
列表共分为 12 个主要板块,收录 355+ 条资源,结构清晰、层次分明:
这是整个列表的思想根基,收录了 OpenAI 和 Anthropic 的 23 篇核心文献,包括:
对于想要从系统层面理解 AI Agent 运作原理的开发者,这 23 篇文献是必读入门路径。
这是列表中资源最密集的板块,收录 206 条内容,分为 12 个子主题:
| 子主题 | 核心内容 |
|---|---|
| Agent Loop | ReAct 范式、Codex Agent Loop 展开、LangGraph 低层概念、Statewright 等 |
| Planning & Task Decomposition | LATS(语言Agent树搜索)、Plan-and-Execute、TaskWeaver、多Agent编排方案 |
| Context Delivery & Compaction | 上下文工程、Claude Compaction 文档、Context 压缩策略 |
| Tool Design | 工具接口设计原则、MCP(Model Context Protocol)、工具 Schema 最佳实践 |
| Skills & MCP | MCP 协议规范、Anthropic MCP 实践、Skill 系统设计 |
| Memory & State | Agent 记忆系统设计、持久化运行时语义、状态管理方案 |
| Permissions & Authorization | Agent 权限系统设计、结构化权限验证(Beyond Permission Prompts) |
| Task Runners & Orchestration | 任务编排框架、多Agent调度器、时间感知推理 |
| Verification & CI Integration | Agent 输出验证、CI/CD 集成、回归测试 |
| Observability & Tracing | Agent 执行追踪、可观测性工具、日志与监控 |
| Debugging & Developer Experience | Agent 调试方法、DevTools 集成、开发体验优化 |
| Human-in-the-Loop | 人机协作模式、人工审核介入机制、反馈回路设计 |
这一板块的信息密度极高,几乎涵盖了 Agent Harness 设计的每一个工程维度。对于正在构建生产级 Agent 系统的团队,可以把这里当作技术选型的资源池来使用。
收录 60 条参考实现资源,分为:
特别值得关注的是 SWE-bench(由 Facebook Research 开发),这是目前最具影响力的 AI Agent 软件工程评测基准,测试 Agent 能否独立完成真实 GitHub Issue 的修复,是衡量 Agent Harness 实际效果的重要标尺。
收录 29 条资源,涵盖:
这一板块在当前 Agent 应用快速落地的背景下尤为重要,因为当 Agent 开始具备文件操作、网络访问、代码执行等高权限能力时,安全边界的设计直接关系到企业能否放心使用。
收录 16 条资源,介绍 Agent 行为评测的框架与工具,包括:
评估体系是 Agent Harness 中常被忽视的一环——多数团队关注的是"如何让 Agent 做对",而忽略了如何衡量 Agent 做对了多少。这一板块帮助填补这个认知缺口。
这是列表最核心的设计哲学:关注 Agent 的运行环境而非 Agent 本身。这意味着列表不会收录 LLM 模型、不会讨论模型训练,而是专注于:当模型给定之后,如何通过 Harness 让它发挥最大效能。
随着模型能力不断增强(更强的推理、更长的上下文窗口),Harness 的某些组件会逐渐变得"不再需要"——列表在开篇也明确指出了这一点。这是一种务实的设计假设,让内容聚焦于今天能真正解决问题的工程实践。
从资源收录来看,维护者有明显的偏好:优先收录 OpenAI 和 Anthropic 工程团队的官方文档和博客,其次是知名研究机构的 arXiv 论文(如 Meta、DeepMind、Stanford),再次是社区认可的开源工具。这种来源层级确保了列表的质量下限。
列表提供了 9 种语言(德语、英语、西班牙语、法语、日语、韩语、葡萄牙语、俄语、中文)的翻译文档,通过 zdoc.app 平台托管。这种国际化程度在 Awesome List 中属于较高水平,反映了维护者对全球开发者覆盖的重视。
强烈推荐以下人群参考此列表:
不太适合:
需要指出几个客观局限:
内容偏向 OpenAI/Anthropic 生态:作为资源列表,这本身无可厚非,但如果你主要使用其他模型(开源模型、其他商业 API),列表的适用性会有所折扣。
Awesome List 的固有局限:资源列表的价值取决于维护者的持续更新。当前仓库每月约更新 1-2 次,但随着 Agent 领域快速发展,某些资源可能很快过时。
中文资源稀缺:列表以英文为主,中文社区的实践案例和工具收录较少,对于国内开发者而言,部分资源的可访问性(网络问题)也是现实障碍。
Awesome Harness Engineering 的出现,折射出一个正在加速的趋势:AI 应用的主要瓶颈正在从模型能力转向系统设计。当 GPT-4、Claude 3.5、Gemini 2.0 等顶级模型的能力差距逐渐缩小时,决定产品成败的不再是"用哪个模型",而是如何设计 Harness。
这个列表的快速增长(1789 星 / 177 Fork / 持续更新)本身就是一个信号:全球开发者正在从"调模型"转向"建系统",对 Harness Engineering 知识的需求正在急剧扩大。作为该领域目前最系统的资源导航,Awesome Harness Engineering 的价值将随 Agent 应用落地加速而持续提升。