agentops
AI Agent 可观测性平台,一行代码接入,实时追踪 LLM 调用、Tool 执行和成本
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI Agent 可观测性平台,一行代码接入,实时追踪 LLM 调用、Tool 执行和成本
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你写了一个 AI 客服 Agent,部署上线后每天处理 1000 条用户对话。但三天后产品经理问:"这 Agent 今天表现怎么样?有多少次回答错了?平均响应延迟多少?Token 花了多少?"
你打开代码,翻日志,对着一屏幕的 traceback 挠头——这就是大多数 AI Agent 开发者的真实困境:Agent 跑起来像黑箱,看不见、摸不着、出了问题只能靠猜。
AgentOps 正是为了解决这个问题而生的。它是一个 Python SDK,给 AI Agent 装上"仪表盘",让你对 Agent 的运行状态了如指掌。

图1:AgentOps 官方 Logo
AgentOps 由 Alex Reibman(@areibman)和 Shawn Qiu(@siyangqiu)于 2023 年创立,总部位于旧金山。这两位创始人均有分布式系统和可观测性领域的背景,亲眼见证了传统软件监控工具(如 Datadog、New Relic)的成熟,但对 AI Agent 领域的监控工具空白感到沮丧。
2023 年底,随着 LangChain、CrewAI、AutoGen 等 Agent 框架的爆发式增长,团队预见到:随着 Agent 系统越来越复杂,开发者的"调试焦虑"会指数级放大。于是他们决定做一个专门面向 AI Agent 的可观测性平台,2024 年正式开源。
目前项目已有 5584 Stars、587 Forks,支持几乎所有主流 Agent 框架和 LLM 提供商,成为 AI Agent 监控领域的事实标准之一。
AgentOps 的核心能力是零侵入式追踪。开发者只需要在代码中初始化一次:
import agentops
agentops.init()
之后所有通过支持的框架调用的 LLM 请求、Tool 调用、Agent 决策过程都会被自动记录。无需手动埋点,无需改业务代码。
追踪内容包括:
AgentOps 提供实时成本监控:每次 LLM 调用的美元成本精确计算,支持多模型横向对比(GPT-4 vs Claude vs Llama)和会话级成本聚合。对于需要优化成本的企业团队,换模型供应商后成本下降 60% 而效果几乎不变的案例并不罕见。
内置评估框架支持对 Agent 进行标准化的性能测试,定义评估指标(准确率、召回率、延迟、成本),在标准数据集上运行并生成可复现的基准报告——为 AI 产品提供客观的"Agent 质量标尺"。
通过 Dashboard 直观查看 Agent 运行状态:Session Tree 以树形结构展示完整执行链路,Waterfall 瀑布图展示各步骤执行时长分布,快速定位性能瓶颈。

图2:Session Tree 视图——以树形结构展示 Agent 的一次完整执行链路
支持 OpenTelemetry 标准,可将追踪数据导出到任何兼容 OTel 的后端(Jaeger、Zipkin、Grafana Tempo),无缝接入已有可观测性基础设施。

图3:Waterfall 瀑布图——展示各步骤的执行时长分布,快速定位性能瓶颈
agentops/
├── client/ # 核心客户端,管理会话和事件上报
├── sdk/ # 新版 SDK,支持 decorators(@trace, @agent, @task)
├── instrumentation/ # 各框架的插桩模块
│ ├── providers/ # LLM 提供商适配(OpenAI, Anthropic, Cohere...)
│ └── agentic/ # Agent 框架适配(LangChain, CrewAI, AutoGen...)
├── integration/ # 回调集成
│ └── callbacks/ # 各框架的回调实现
├── logging/ # 日志配置
└── semconv/ # OpenTelemetry 语义约定
| 层次 | 技术选型 | 说明 |
|---|---|---|
| 追踪标准 | OpenTelemetry | 行业标准的可观测性协议 |
| HTTP 客户端 | httpx + requests | 同步/异步 LLM 请求拦截 |
| 仪表盘前端 | Next.js(app/dashboard/) | 完整的 Web UI |
| 数据后端 | Supabase + ClickHouse | PostgreSQL 元数据 + ClickHouse 时序数据 |
| 依赖注入 | wrapt(猴子补丁) | 自动包装 LLM 调用,无需修改原始代码 |
这是 AgentOps 最巧妙的地方。通过 wrapt 库动态包装第三方库(如 openai, anthropic)的函数,在完全无感知的情况下插入追踪逻辑。这种"魔法"式的集成方式,是 AgentOps 能够支持 20+ 框架而不需要每个框架单独维护插件的根本原因。
支持的 Agent 框架: CrewAI、CrewAI Tools、LangChain、LangGraph、AutoGen、AG2(微软)、OpenAI Agents SDK、DSPy、Google ADK、CAMEL、Agno。
支持的 LLM 提供商: OpenAI、Anthropic、Google Gemini、Azure OpenAI、Cohere、Mistral、Groq、Ollama(本地模型)。
无论用哪个框架、哪个模型,AgentOps 几乎都能监控。
pip install agentops
import agentops
# 方式1:API Key 方式(推荐)
agentops.init(api_key="your-api-key")
# 方式2:开发模式(本地查看,不上传云端)
agentops.init(dev=True)
# 之后正常运行你的 Agent 代码
from crewai import Agent, Task
# ... 你的业务代码 ...
cd app
cp .env.example .env
# 填写 Supabase / ClickHouse 配置
docker compose up
Dashboard 使用 Next.js + Supabase + ClickHouse,需要自行准备数据库资源。

图4:API Keys 管理界面——在 Dashboard 中创建和管控访问密钥

图5:Session Link——AgentOps 自动生成会话链接,可直接分享给团队成员查看追踪详情
官方 Dashboard(app.agentops.ai)是云端服务,LLM 调用数据(包括 Prompt/Response)会上传到 AgentOps 服务器。对于处理敏感数据的企业,这是一个需要评估的隐私风险。解法是使用自托管或 dev=True 模式。
wrapt 猴子补丁虽然方便,但有潜在风险:与其他也使用 monkey patching 的库可能冲突;第三方库版本升级可能导致补丁失效;在某些严格的安全沙箱环境中可能无法生效。
自托管需要配置 Supabase + ClickHouse + Docker Compose,对于没有 DevOps 经验的开发者有一定门槛。
虽然声称支持 20+ 框架,但对某些小众框架的集成质量参差不齐。文档中推荐使用特定版本组合,跨版本可能出现兼容性问题。
AgentOps 的出现代表了 AI Agent 开发工具链的一个必然方向:可观测性。
传统软件有成熟的监控体系(APM、Logging、Tracing),但 AI Agent 引入了新的复杂性:LLM 的非确定性输出、多 Agent 协作的决策树、Prompt 工程对效果的巨大影响、Token 成本优化。AgentOps 填补了这个空白。
从行业趋势看,随着 Agent 系统越来越复杂(多 Agent 协作、RAG 增强、外部工具调用),对可观测性工具的需求只会增加。类似 Datadog 之于微服务,AgentOps 正在成为 AI Agent 领域的基础设施。
| 维度 | 评分 | 说明 |
|---|---|---|
| 集成广度 | ★★★★★ | 支持 20+ 框架,几乎覆盖主流生态 |
| 部署简便性 | ★★★★☆ | pip install 即可,Dashboard 可选 |
| 代码质量 | ★★★★☆ | 活跃维护,MIT 许可,文档完善 |
| 可扩展性 | ★★★★★ | OpenTelemetry 原生支持,生态可扩展 |
| 隐私合规 | ★★★☆☆ | 云端模式需注意数据隐私 |
AgentOps 是目前最值得关注的 AI Agent 监控工具之一。对于正在构建或维护 AI Agent 应用的团队,它能显著提升调试效率和成本透明度。