aiperf
NVIDIA 出品的 LLM 推理性能基准测试工具,支持 TTFT/ITL 等核心指标,九服务分布式
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NVIDIA 出品的 LLM 推理性能基准测试工具,支持 TTFT/ITL 等核心指标,九服务分布式
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:AIPerf 实时 TUI Dashboard,呈现 LLM 推理全链路性能指标
部署了大语言模型推理服务后,你是否面临这样的困惑:
AIPerf 由 NVIDIA Dynamo 团队 开发和维护(维护邮箱 sw-dl-dynamo@nvidia.com),项目源码中多处可见 Apache-2.0 版权声明。当前版本 0.8.0,发布于 PyPI,支持 Python 3.10+。
NVIDIA 此前已有 Dynamo 推理优化框架(专注于 KV Cache 管理、speculative decoding 等),AIPerf 作为其性能评测基础设施,用于量化不同推理方案的实际表现,形成「优化 → 评测 → 再优化」的正向循环。
项目仓库活跃度高,持续更新,特色分支 add-deepseek-v4 表明其对 DeepSeek 系列模型有专项适配,且直接依赖 HuggingFace transformers 的深度定制版本(git+https://...@add-deepseek-v4)。
AIPerf 采用 9 个独立服务进程通过 ZMQ 消息总线通信 的分布式架构,分为三层:
AIPerf 支持三种基准测试模式,满足不同场景需求:
AIPerf 输出丰富的时序指标:
AIPerf 不只是一个 HTTP 压测工具,它还内置了多套权威数据集:
pip install aiperf
一行命令即可安装,或通过 Docker 构建自定义镜像:
# 多阶段 Dockerfile,支持 wheel 构建和环境打包
docker build --target wheel-artifact --output type=local,dest=./dist .
aiperf profile \
--model "granite4:350m" \
--streaming \
--endpoint-type chat \
--tokenizer ibm-granite/granite-4.0-micro \
--url http://localhost:11434 \
--concurrency 5 \
--request-count 10
AIPerf 提供完整的插件机制,通过 YAML 注册扩展支持的端点、数据集、传输协议和指标类型,开源友好。
| 类别 | 技术 |
|---|---|
| 核心框架 | Python 3.10+ async/await |
| 通信总线 | ZMQ(ZeroMQ) |
| Web 服务 | FastAPI + Uvicorn |
| 数据处理 | Pandas、NumPy、PyArrow |
| 可视化 | Plotly、Dash、Matplotlib、Seaborn |
| CLI UI | Textual(实时 TUI)、Rich |
| LLM 接口 | HuggingFace Transformers(深度定制版)、Tiktoken |
| 监控 | Prometheus client、nvidia-ml-py |
| 验证 | Ruff(lint + format)、Pre-commit(17 个钩子)、Pytest |
| 代码规范极为严格:强制类型提示、Pydantic 数据校验、禁止阻塞调用、日志用 Lambda 延迟求值,每个提交都经过 17 个 pre-commit 钩子检查。测试覆盖率通过 Codecov 监控,CI 流水线完善。 |
git+https://github.com/huggingface/transformers.git@add-deepseek-v4 而非 PyPI 版本,依赖链较深,遇到兼容性问题时排查成本较高。AIPerf 的出现填补了 LLM 推理性能基准测试的开源工具空白。在此之前,业界主要依赖闭源工具或自行开发的简单脚本,缺乏标准化的评测框架。NVIDIA 将内部工具开源,既服务于自身的推理优化工作,也推动了整个 LLM 推理生态的标准化进程。 随着 vLLM、SGLang、TensorRT-LLM 等推理框架的竞争加剧,客观可复现的基准测试工具变得愈发重要——这正是 AIPerf 的核心价值所在。