live-swe-agent
首个运行时自我进化的AI软件工程师Agent,在SWE-bench Verified上以79.2%登顶开源框架榜首
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个运行时自我进化的AI软件工程师Agent,在SWE-bench Verified上以79.2%登顶开源框架榜首
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:凌晨两点,你的团队正准备发布一个新功能,突然 CI 流水线报错了——一个三方依赖库在某处做了一个不兼容的版本更新,导致你们的代码无法正常运行。传统方案中,你需要手动排查、定位根因、修改代码。而现在,一个 AI 助手不仅能完成这些,还能在修复这个 Bug 的过程中,顺手把自己的「解题策略」也升级了,下次遇到类似问题,速度更快、准确率更高。
这并不是科幻——Live-SWE-agent 正在让这件事成为现实。
2025 年 11 月,该项目在 SWE-bench Verified 基准测试中,搭载 Claude Opus 4.5 取得了 79.2% 的解决率,力压所有开源 Agent 框架,逼近 Anthropic 内部手工调优的专有框架成绩。同年,基于 Gemini 3 Pro 更是达到了 77.4%,问鼎当时所有可用模型榜首。

图1:各主流模型在 SWE-bench Verified 上的表现排行榜,Claude Opus 4.5 + Live-SWE-agent 以 79.2% 登顶。
Live-SWE-agent 的核心理论并不复杂,却极具启发性:现代 LLM驱动的 Agent 本身就具备了修改自身行为的能力。传统 Agent 框架(如 LangChain、AutoGPT)将 Agent 视为固定策略的「执行器」——Prompt 写死了,策略就固定了。而 Live-SWE-agent 反其道而行:Agent 是软件,软件的本质就是可以被修改和扩展的。
具体来说,Live-SWE-agent 在运行时(runtime)能够:
这不是简单的「Few-shot Prompt Engineering」,而是一种真正的元学习(Meta-Learning)能力——Agent 在解决问题的同时改进自己解决问题的方式。
Live-SWE-agent 的代码库极为精简,核心只有两大部分:
OpenAutoCoder/live-swe-agent/
├── config/ # 配置文件目录
│ ├── livesweagent.yaml # 通用配置
│ ├── livesweagent_swebench.yaml # SWE-bench 测试配置
│ └── livesweagent_swebench_pro.yaml # SWE-Bench Pro 测试配置
├── assets/
│ ├── leaderboard.png # 排行榜图片
│ └── comparison.png # 对比图
├── README.md
└── LICENSE
没错,这个仓库本身不包含核心代码逻辑——它是一个配置驱动型的 Agent 策略框架。Live-SWE-agent 基于 mini-swe-agent(5423★)构建,提供了三套 YAML 配置文件,分别对应不同场景。
livesweagent.yaml 中定义了 Agent 的核心行为模板:
System Prompt 模板:定义了 Agent 的思维框架和工作流。Agent 被要求:
echo COMPLETE_TASK_AND_SUBMIT_FINAL_OUTPUT 结束任务。Instance Prompt 模板:接收具体的 Issue 描述,指导 Agent 解决该问题。
Live-SWE-agent 的能力边界由 mini-swe-agent 的技术栈决定:
| 组件 | 技术选型 | 作用 |
|---|---|---|
| LLM 路由 | litellm | 统一接口调用 OpenAI / Anthropic / Gemini 等多厂商模型 |
| Agent 框架 | textual + typer | TUI 交互界面和命令行入口 |
| 数据结构 | pydantic v2 | 类型安全的数据模型 |
| 模板引擎 | Jinja2 | 动态 Prompt 渲染 |
| HTTP | requests | API 调用 |
| 配置管理 | pyyaml | YAML 配置解析 |
| 并发/重试 | tenacity | API 调用的指数退避重试 |
| 测试 | pytest + pytest-asyncio | 单元测试和异步测试 |
技术栈非常务实,没有引入过多抽象层,保持了代码的可维护性。
# 1. 安装 mini-swe-agent(底层框架)
pip install mini-swe-agent
# 2. 下载 Live-SWE-agent 配置
git clone https://github.com/OpenAutoCoder/live-swe-agent.git
cd live-swe-agent
# 3. 设置 API Key(支持 OpenAI / Anthropic / Gemini 等)
export OPENAI_API_KEY=sk-... # 或 ANTHROPIC_API_KEY / GEMINI_API_KEY
# 4. 启动 Agent(传入具体 Issue)
mini --config config/livesweagent.yaml
输入:一段 GitHub Issue 描述(如「模块 X 在 Python 3.12 下导入报错」)
输出:Agent 自动完成以下步骤:
| 基准集 | 说明 | 最高分 |
|---|---|---|
| SWE-bench Verified | 真实 GitHub Issue 精选集 | 79.2%(Claude Opus 4.5) |
| SWE-Bench Pro | 更难的真实问题集 | 45.8%(Live-SWE-agent 1.0) |
该 repo 还在 Hugging Face 上发布了完整的运行轨迹和 Patch 数据集,方便研究者复现和对比。
Live-SWE-agent 的出现代表了一个重要的范式转变。
传统 Agent 框架的思路是:人设计策略,机器执行。人的设计能力就是上限。
Live-SWE-agent 的思路是:机器在执行中优化策略,策略本身成为被优化的对象。这意味着 Agent 的能力不再受限于设计者的事先规划,而能随着处理任务的增多而持续增长。
如果这个方向被验证可行(已经取得了 SOTA 结果),未来可能出现:
该项目由德克萨斯大学奥斯汀分校的张黎明教授团队发起,论文已发表于 arXiv(2511.13646),代表了学术界对 AI + 软件工程交叉领域的最新探索。
Live-SWE-agent 是一款以「运行时自我进化」为核心差异点的 AI 软件工程 Agent。它不追求代码库的规模,而是通过极简的配置文件策略 + 强大的 LLM 推理能力,在 SWE-bench 基准上击败了所有开源对手。它让我们第一次看到:AI 不仅能解决问题,还能在解决问题的过程中让自己变得更擅长解决问题。
如果你的团队在探索 AI 编程助手的下一代形态,这个项目值得关注。