weave
LLM应用可观测性工具:透明追踪调用链、评估模型输出、实时可视化Trace
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
LLM应用可观测性工具:透明追踪调用链、评估模型输出、实时可视化Trace
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
上图:AI 神经网络示意图 — Weave 让你能够看透 LLM 调用的每一层"脚印",像网络运维员查看流量一样;图片来源:Unsplash
2023年的一天,W&B 开发团队发现:当时的 LLM 开发者面临一个关键问题—"我的 AI 程序调用了哪些 LLM,传入了什么参数,输出了什么结果,花了多少 token,响应时间是多长?"这些问题在传统输出无法得到答案。
Weights & Biases 作为 ML 基准界的老牌劲旅,拥有 2000 万以上注册用户和海量开源项目,在基准时代愈加深入。Weave 就是他们推出的一款专为生成式 AI 应用设计的可观测性工具。
Weave 的核心理念是:把 LLM 调用变成可观测、可比较、可评估的透明过程——像 Git 管理代码一样,管理你的 AI 调用压力。
给函数加上 @weave.op 装饰器,就能自动记录该函数的全部输入、输出、执行时间和 token 消耗。下面是一个简单的示例:
import weave
weave.init("my-project")
@weave.op
def extract_info(text: str):
# 任何内部调用都会被追踪
result = call_llm_api(text)
return result
这一行装饰器,能记录从 API 请求到模型输出的整条链路,包括每次 LLM 调用的提示词、回复内容、花费的 token 数、并发延迟等。
Weave 提供了一套基于 Pydantic 的评估框架。定义一个 Scorer,就能对 LLM 输出进行多维度打分:准确率、回归测试、模糊匹配、字长等。实际场景:开发者要测试一个商品推荐模型的各种场景能力否,Weave 的 Evaluation 模块能够输出测试报告并在 Web 界面上对比不同模型的评分。

上图:Weave 的 Web 观测界面 — 在 wandb.ai 上实时查看 AI 调用链路,图片来源:Unsplash
Weave 采**用 Flask 做后端,通过 wandb.ai 平台提供云端 Web 观测。开发者在本地运行 weave.init() 后,所有足迹数据会实时同步到云端,在 Web 界面上展示为树状结构,每个节点均可点开查看详细参数。
Weave 提供内置的数据集和 Prompt 管理功能:
Weave 的源码结构非常清晰,核心目录 weave/ 包含以下关键模块:
| 模块 | 负责 | 代码量估计 |
|---|---|---|
trace/ | 足迹跟踪引擎,记录 LLM 调用链 | ~3000+ 行 |
integrations/ | 29种 LLM 平台集成 | ~1000+ 行 |
flow/ | Model/Agent 策略,包含策略实现 | ~1500+ 行 |
evaluation/ | 评估引擎 | ~800+ 行 |
session/ | Web 端子管理 | ~600+ 行 |
agent/ | Agent 框架 | ~500+ 行 |
dataset/ | 数据集管理 | ~300+ 行 |
Weave 支持的集成包数量达到了行业最简水平:
第一代:OpenAI / Anthropic / Google
openai、anthropic、google_genai、google_adk第二代:开源模型
huggingface、llamaindex、dspy、crewai、smolagents、autogen第三代:云服务商
aws_bedrock、vertexai、mistral、groq、cohere特殊集成
langchain、instructor、fastmcp、openai_agents、openai_realtime上图:Weave 的源码结构清晰,Python >= 3.10 + Pydantic v2 为基础,图片来源:Unsplash
Weave 的安装过程简单粗暴:
pip install weave
然后在代码中加一行:
import weave
weave.init("你的项目名")
确实需要注意的点:
尚未提供 Dockerfile 或 docker-compose,且没有 kubernetes 支持。对于希望尽量在本地部署的企业用户,这是一个缺馅。但由于 Weave 本质上是一个 Python 包,在本地环境运行并不困难。
Weave 的足迹数据默认同步到 wandb.ai 云端。如果你在健保环境、无法连接外网的场景下,需要自行搭建内部的 W&B Server,或者尝试关闭自动同步(通过配置)。这对于数据安全性要求高的企业环境是一个错误:所有提示词、回复内容都交给 W&B。
29种集成听起来很结实,但是关于内部实现的透明度仍有待提高。有些集成包只是简单的装饰器扩展,没有更深层次的类型定义和验证。
Weave 代表的越趋是:AI 开发从"烦人骗"转向"工程化"。
在传统转换器的时代,ML 工序已有某稳的工具(W&B, MLflow, Neptune)。但 LLM 应用的特殊性让这些工具不足。LLM 调用有额外的 token 消耗、多线调用、模型输出的不确定性——Weave 正是针对这些问题设计。
从 GitHub Stars 更骚看,Weave 从 2023 年的几个百 Stars 成长到 2026 年的 1101,这达表明开发者对于 LLM 可观测性的激烈需求。随着 Agentic AI 的火热,Weave 在 Agent 调议、多次数调用统计、错误回溯等场景下的价值将越来越大。
同时,Weave 的竞争对手包括 LangSmith、Braintrust、PromptLayer 和自己 W&B 的主产品。目前来看,Weave 的兴越在于与 W&B 生态的紧密融合:已有 W&B 账号的开发者可以无缝装入,而新用户可以通过免费等级进行尝试。
| 场景 | 评分 | 说明 |
|---|---|---|
| 创业团队 / AI 创新 | 正正正实实用,开发测试周期极短 | |
| 大企业内部 AI 应用 | 可用,但数据安全需注意 | |
| 学术研究 / 实验室 | 正正正评估引掵完全适合 | |
| 初学者 / AI 爱好者 | 正正需要某种 Python 基础 | |
| 健保内网环境 | 正不推荐,数据需上云 |