RagaAI-Catalyst
Agent AI 可观测性平台:追踪 LLM 调用、可视化决策链路、量化评估 AI 应用表现
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Agent AI 可观测性平台:追踪 LLM 调用、可视化决策链路、量化评估 AI 应用表现
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你的团队花了两周构建了一个多 Agent 协作系统——主 Agent 负责理解用户意图,子 Agent 分别调用搜索、数据库和邮件工具。每个环节看起来都正常,但最终输出的答案却答非所问。
问题出在哪?你完全没有头绪。
传统软件开发中,IDE 的调试器可以逐行追踪代码执行,API 调用有日志可查。但当你的应用核心是 LLM 调用和 Agent 决策时,这些工具集体「失明」了——你不知道模型收到了什么 prompt,不知道某个工具为什么返回了错误,更不知道 Agent 的思考链路是否跑偏了。
RagaAI Catalyst 正是为了解决这个痛点而生。它是一个专门为 Agent AI 系统打造的观测平台,让开发者能够像调试传统代码一样,追踪、监控和评估 AI 应用的实际运行过程。
RagaAI 团队在开发 RAG 应用时发现,市面上缺乏针对 AI Agent 的专业调试工具。传统的应用性能监控(APM)只关注基础设施层面,而 LangSmith 等竞品要么闭源,要么在多 Agent 场景支持上不够深入。
团队决定自己动手,从内部的调试需求出发,逐步构建了完整的观测框架,并在 2024 年底将核心代码开源,迅速在 GitHub 获得了 1.6 万颗星,成为 AI Agent 可观测性领域的标杆项目。
RagaAI Catalyst 的核心能力围绕三个维度展开:
智能追踪(Tracing):通过在代码中插入几行初始化代码,Catalyst 可以自动捕获 LLM 调用、工具执行和 Agent 决策的完整链路。追踪数据以时间线的形式可视化展示,开发者可以清晰地看到每次 Agent 决策背后的上下文、输入输出和耗时分布。

项目内置了对主流框架的深度集成,包括 LangChain、LlamaIndex、CrewAI、Haystack、Smolagents 和 OpenAI Agents SDK。无论你使用哪种框架,只需替换少量代码即可接入追踪,无需对业务逻辑做大改。追踪粒度精确到每一次 LLM API 调用和每一个工具执行,支持 OpenTelemetry 标准导出,可以对接 Jaeger、Zipkin 等专业链路追踪系统。
评估体系(Evaluation):追踪只能发现问题,但评估才能量化改进。Catalyst 提供了指标管理(Metrics)和实验管理(Experiments)两大模块,开发者可以定义自定义评估指标(比如答案准确率、响应延迟、工具调用成功率),并通过 A/B 测试对比不同 prompt 或模型配置的效果。

在数据集管理方面,Catalyst 支持从 CSV、DataFrame 或 JSONL 文件导入测试数据集,定义 schema 映射后即可批量运行评估。相比手动跑测试,这种方式自动化程度高,结果可以持久化保存,方便回归对比。
安全护栏(Guardrails):AI 系统的输出并非总是可信——模型可能泄露用户隐私、生成有害内容,或在特定领域给出误导性答案。 Catalyst 内置了 Guardrails 模块,支持 PII(个人身份信息)脱敏、自定义内容过滤和输出校验,帮助开发者在生产环境中守好最后一道关。

从代码结构来看,RagaAI Catalyst 采用了经典的「客户端采集 + 服务端存储」架构:
ragaai_catalyst/):纯 Python 包,定义了 Tracer、Dataset、Evaluation、PromptManager 等核心类,通过 OpenTelemetry 的 instrumentation 机制自动 hook 主流 AI 框架的 API 调用。tracers/):细分为 agentic_tracing(多 Agent 链路追踪)、instrumentators(各框架的集成器)和 exporters(数据导出器),支持将追踪数据推送到自建后端或 RagaAI 云端平台。evaluation.py、experiment.py):提供指标定义、实验设计和结果分析能力。整体依赖较为丰富,涵盖了 LangChain、LlamaIndex、OpenAI、LiteLLM 等主流 AI 中间件,以及 OpenTelemetry 全家桶。这种设计的好处是对主流框架的覆盖非常全面,坏处是依赖树较深,首次安装可能需要几分钟。
从部署角度看,Catalyst 的 SDK 本身非常轻量,通过 pip install ragaai-catalyst 即可完成安装,官方要求 Python 3.10 及以上版本。Dashboard 提供两种使用方式:注册 RagaAI 云端账号直接使用(推荐,开箱即用),或者按照文档自建后端服务(适合对数据隐私有要求的企业)。

不过需要指出的是,当前版本缺少 Docker 部署包,对于希望完全自托管的开发者来说,需要自行封装 Dockerfile,这增加了初次上手的成本。
实际体验下来,Catalyst 的上手流程相对友好。按照 Quickstart 文档的指引,完整流程分为三步:
第一步安装:pip install ragaai-catalyst,耗时约 2 分钟(取决于网络)。第二步在 catalyst.raga.ai 注册账号并生成 API Key,然后在代码中初始化 SDK 并填入密钥。第三步接入追踪,Auto-Instrumentation 模式可以自动捕获 LangChain/LlamaIndex 的调用,开发者几乎不需要修改业务代码。
对于 LangChain 用户,只需替换 langchain.callbacks 中的 CallbackHandler 为 Catalyst 提供的 RagaAITracer,就可以开始追踪。LlamaIndex 用户类似,也有专门的 RagaAILLMIndexCallbackHandler 和 RagaAIAgentIndexCallbackHandler。
真正有挑战的是评估环节。虽然 Catalyst 提供了指标管理和实验功能,但实际使用中需要开发者对「什么是好的 AI 输出」有清晰的定义——这一点本身就没有标准答案,需要结合具体业务场景设计合理的评测维度和打分规则。
RagaAI Catalyst 的出现,折射出一个更大的行业趋势:随着 AI 应用从单点调用走向多 Agent 协作,传统的调试和监控方法正在失效。2024 年下半年开始,AI 可观测性(AI Observability)从一个新兴概念迅速成为业界刚需,Cursor、Windsurf 等 AI 编程工具的爆发式增长也加剧了这种需求——当 AI 参与关键决策时,能否「看到」它的思考过程直接决定了开发者能否有效优化系统。
从 GitHub Stars 增长曲线来看,RagaAI Catalyst 在开源后的增速非常健康,目前稳居 AI Agent 工具链的明星项目行列。随着团队持续更新,未来如果能补齐 Docker 一键部署和多租户支持,在企业级市场也有望占据一席之地。

项目目前仍处于快速迭代阶段,以下几点值得关注:
自托管门槛较高:缺少 Docker 部署包,企业用户如果不想使用云端 SaaS,需要自行构建后端服务,学习成本不低。
评估设计依赖业务理解:框架提供了工具,但「评估什么」和「怎么打分」需要开发者自行设计,这仍然是 AI 应用落地的核心难题。
依赖树较深:安装时需要拉取大量 AI 中间件依赖,首次部署可能遇到版本冲突问题,建议使用虚拟环境。
云端 SaaS 数据隐私:使用云端 Dashboard 意味着追踪数据会上传到 RagaAI 服务器,对于金融、医疗等敏感行业,可能存在合规顾虑。
总体来说,RagaAI Catalyst 是目前 AI Agent 可观测性领域最完整的开源解决方案之一。如果你正在构建多 Agent 系统,或者需要系统性地评估和优化 LLM 应用的表现,这个工具值得一试。