agent-lightning
微软研究院开源的 AI Agent 强化学习训练框架,支持零代码侵入式优化任意框架的 Agent
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
微软研究院开源的 AI Agent 强化学习训练框架,支持零代码侵入式优化任意框架的 Agent
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你花了一周调好的 AI 助手,换了个场景就"失灵"了——这几乎是所有 AI 开发者共同的经历。传统方式靠人工 Prompt 工程反复试错,效率低且泛化差。2025 年,微软研究院开源了 Agent Lightning,给出了一个近乎"作弊"的解决方案:不用改你一行代码,就能用强化学习把任意 AI Agent 训练得更好。

图1:Agent Lightning 核心架构图
AI Agent(如对话助手、代码生成器、SQL 机器人)的能力上限,往往取决于"训练"阶段的水平。早期的 Agent 主要靠监督微调(SFT),但 SFT 存在数据成本高、泛化差的问题,尤其当 Agent 需要多步推理、工具调用或自我纠错时,静态数据集根本覆盖不了真实场景的复杂性。
2025 年前后,强化学习(RL)在 LLM 领域取得突破性进展——OpenAI o1/o3、DeepSeek-R1 等推理模型先后证明了 RL Scaling 的威力。但这些进展主要集中在"模型本身"的推理能力,如何用 RL 训练已有的第三方 Agent(即你没有源码的 Agent),一直是个难题。Agent Lightning 正是为了解决这个痛点而生。
项目由微软研究院主导,2025 年 8 月发布 arXiv 论文,2026 年初正式开源 v0.3.1。目前 GitHub 已有超过 1.7 万 Stars,Youtu-Agent(腾讯)等企业已在 128 GPU 规模上验证了其规模化训练能力。
Agent Lightning 的核心理念是非侵入式集成:你的 Agent 代码一行都不用改,只需要在关键位置插入几行 agl.emit_xxx() 调用,框架就能自动采集轨迹数据(Trajectory),送入强化学习算法优化。
整个系统由四个核心组件构成:
1. Runner(运行器):负责驱动 Agent 执行任务。可以是 LangChain Agent、AutoGen 团队、OpenAI Agent SDK,甚至纯 Python + OpenAI API 的脚本。Runner 会把每次执行过程记录为 span(跨度),包含 prompt、tool_call、reward 等结构化信息。
2. Tracer(追踪器):被动监听 Agent 的执行过程,自动注入观测点,采集完整的执行轨迹。无需修改 Agent 源码,只需一行 agl.emit_xxx() 或启用装饰器即可。
3. LightningStore(存储中心):MongoDB-backed 的数据中枢,存储任务定义、资源(prompts/templates)、执行轨迹(traces)和评估结果。提供 OpenAPI 接口,支持可视化 Dashboard 访问。
4. Algorithm(算法引擎):可插拔的算法模块。内置支持包括 GRPO(DeepSeek 风格)、APO(自动提示优化)、VERL(基于 vLLM 的 RL)、Fast(轻量优化)等,也支持自定义算法。

图2:Dashboard 中的训练轨迹页面
训练流程非常直观:Trainer 先从 Store 拉取数据集,交给 Runner 并行执行多组 Rollout,Tracer 收集轨迹后写入 Store,Algorithm 读取轨迹计算 reward,更新策略资源(如改进的 prompt template 或 model weights),再写回 Store。整个循环持续迭代,直到收敛。
这是 Agent Lightning 最亮眼的能力之一。项目明确列出支持的框架包括:
adapter/langchain.py 集成openai 库这种广泛兼容性的秘密在于 adapter 层设计:每个框架有自己的消息格式(Dict/List/Str),adapter 负责统一转换为 Agent Lightning 的标准化消息格式(Triplet:<user, assistant, tool> 三元组)。

图3:Dashboard 中的 Rollouts 页面
SQL 自修正 Agent(论文基准):用 RL 训练 Agent 学会"写 SQL 并自我纠错"。传统 SFT 训练出的 Agent 只能模仿训练数据中的纠错模式,泛化能力差。而 RL 训练出的 Agent 在 Bird 测试集上准确率提升了 18%,关键在于它学会了根据执行结果(reward = SQL 执行是否成功)自主探索纠错策略。
Tinker 提示词优化:2025 年 11 月的一篇 Medium 文章详细描述了用 Agent Lightning + Tinker 优化任意 Agent 的流程。只需提供原始 Prompt 和评估函数,框架自动生成变体、rollout、评估、收敛。整个过程无需人工介入。
多 Agent 协同优化:支持在多 Agent 系统中选择性优化特定 Agent。比如在一个 Planner-Executor-Verifier 架构中,可以只优化 Verifier 而保持 Planner 不变,这是传统微调方法做不到的。

图4:OpenTelemetry 追踪示例
安装方式非常简单,一行 pip 即可:pip install agentlightning。但要完整运行训练流程,还需要:
docker compose 一键启动官方提供了多套 docker compose 配置(Store、Grafana、Prometheus),但并非"一键启动所有功能"。Dashboard 是一个亮点:React + Vite 构建的 Web 界面,可以实时查看训练进度、轨迹回放、reward 曲线。
pydantic 数据建模,FastAPI + Flask,uvicorn/gunicorn 生产部署litellm[proxy] 统一 LLM 调用,vLLM 高性能推理verl(vLLM-based RL)、transformers、trl 等代码质量较高:完整类型注解(pyright)、pre-commit 钩子、CI/CD 单元测试、Examples 集成测试。文档质量优秀,有完整的 MkDocs 文档站点。
Agent Lightning 代表了一个重要趋势:AI Agent 的训练从"炼模型"走向"炼策略"。过去业界关注的是如何训练更强的 LLM 本身;Agent Lightning 证明,在 LLM 能力已经足够强的背景下,**训练 Agent 的决策策略(即如何组织工具调用、如何自我纠错、如何分配任务)**具有巨大价值。
腾讯 Youtu-Agent 在 128 GPU 上验证了规模化可行性,说明这套框架具备生产级能力。随着 vLLM 等推理引擎的持续优化,训练成本将进一步下降,Agent Lightning 这类工具的适用范围会越来越广。