InferenceX
实时追踪 vLLM/SGLang/TensorRT-LLM 在 NVIDIA/AMD 顶级 GPU
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
实时追踪 vLLM/SGLang/TensorRT-LLM 在 NVIDIA/AMD 顶级 GPU
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
**想象一个场景:**某天早晨,全球最大的几家 AI 实验室的基础设施负责人几乎同时收到了同一份报告——过去 72 小时内,开源推理引擎 vLLM 0.11.2 在 H100 集群上的吞吐量比三天前提升了 7%;而 SGLang 0.5.6 配合 DeepSeek-R1 FP4 精度在 B200 上已经全面超越 TensorRT-LLM。这不是某篇论文的预测,而是 InferenceX 实时追踪的基准测试数据,正在每小时更新。

图1:SemiAnalysisAI 组织头像 —— 来自半导体行业最深度分析机构之一
LLM 推理性能由两件事共同驱动:硬件 和 软件。硬件创新每年带来一次性能跃迁——新 GPU、新系统架构。但软件每天都在进化:SGLang、vLLM、TensorRT-LLM、CUDA、ROCm 通过内核级优化、分布式推理策略、调度创新,在相邻发布版本之间就能实现数个百分点的提升,有时发布间隔甚至只有几天。
这带来了一个根本矛盾:在某个时间点做的基准测试,很快就会过时,无法反映最新软件包能达到的真实性能。
InferenceX(前身 InferenceMAX)正是为解决这一问题而生。它是 SemiAnalysis 团队(以半导体行业深度分析闻名的机构)推出的开源持续推理基准测试平台,已获得 OpenAI、Microsoft、Oracle、Pytorch Foundation、vLLM、SGLang、Tri Dao 等顶级机构和个人背书。
InferenceX 的架构分为三大层次:
第一层:基准测试引擎 (benchmarks/)
核心是 benchmark_lib.sh(约 40KB 的共享 bash 工具库),负责 GPU 监控、功率计量、性能数据收集。它支持 NVIDIA (nvidia-smi) 和 AMD (amd-smi) 双平台,记录每秒 GPU 指标并写入 CSV 文件,再通过 utils/aggregate_power.py 聚合为平均功耗和每输出 token 能耗(Joules/output token)。
单节点基准脚本(benchmarks/single_node/)覆盖固定序列长度(fixed_seq_len/)和可变长度(speedbench/)两种测试模式;多节点脚本(benchmarks/multi_node/)处理 disaggregated prefill+decode、专家并行(EP)等分布式场景。
第二层:推理引擎 Runner(runners/)
Runner 是一组针对不同硬件厂商和云服务商的 launcher 脚本,是衔接 GitHub Actions 自动化与实际 GPU 集群的桥梁:
launch_b200-cw.sh → CoreWeave B200launch_gb200-nv.sh → NVIDIA GB200 NVL72(OCI 云)launch_gb300-nv.sh → NVIDIA GB300 NVL72launch_h100-cr.sh → Crusoe H100launch_mi300x-amds.sh → AMD MI300X每个 runner 都遵循 Slurm 作业调度规范(--partition, --account, --nodes),通过 srun 启动容器化推理服务,容器镜像由对应云厂商提供(NVIDIA NGC、AMD Infinity Hub)。
第三层:分析工具(utils/)
aggregate_power.py:GPU 功率聚合,输出每 token 能耗compare_results.py:跨版本横向对比generate_aiperf_plots.py:生成可视化图表collect_eval_results.py:LLM 评估结果采集matrix_logic/:Pydantic 验证的 sweep 配置生成(generate_sweep_configs.py),测试覆盖完整InferenceX 追踪的推理框架版本更新极为频繁(从 perf-changelog.yaml 可见每 1-2 周就有版本更新):
| 推理引擎 | 关键版本更新历史 |
|---|---|
| vLLM | 0.10.2 → 0.11.0(增加 PIECEWISE cudagraph 模式)→ 0.11.2 |
| SGLang | 0.5.5 → 0.5.6(统一 NVIDIA 镜像标签,EP 参数调整) |
| TensorRT-LLM | 1.2.0rc0.post1 → 1.2.0rc2 |
| ATOM | AMD 生态推理引擎 |
支持的精度格式:FP4(4bit)、FP8(8bit)、FP16,以及激进的量化方案如 DeepSeek-V4 FP4(仅需 80GB 显存)。
支持的模型涵盖:Llama-70B、DeepSeek-R1(DSR1)、DeepSeek-V4(DSv4)、GPT-OSS(国产大模型)、Qwen3.5、KimiK2.5、GLM-5、MiniMax-M2.5 等,覆盖从中等到超大规模(8B~1T 参数)的全谱系。
InferenceX 获得的硬件支持堪称豪华,背后是多家顶级云厂商的算力捐赠:
NVIDIA 阵营:
AMD 阵营:
这些 GPU 通过 disaggregated prefill+decode、专家并行(EP)等分布式策略组合,形成多节点测试能力,支撑起从单卡到 72-GPU 机架的全栈性能评估。
InferenceX 的核心工程价值在于其自动化持续交付管道。看 .github/workflows/ 目录,可见一整套 CI/CD 流程:
run-sweep.yml:触发一轮完整 sweep 基准测试benchmark-tmpl.yml:单节点基准测试模板benchmark-multinode-tmpl.yml:多节点模板collect-results.yml:自动采集结果profile.yml:GPU profiling 任务pr-recipe-reminder.yml:PR 提交时提醒更新基准配方所有配置变更(版本升级、参数调整)都会追加到 perf-changelog.yaml,形成不可篡改的变更历史,同时触发对应的基准测试任务。最近的变更包括 vLLM 0.11.2 升级、DeepSeek SGLang 镜像更新、FP4 kv-cache-dtype 配置等。
实时性:相比 MLPerf Inference 等传统基准测试(年度发布),InferenceX 的版本追踪粒度是小时级,能捕捉到推理引擎每一次提交带来的性能变化。
硬件多样性:横跨 NVIDIA Blackwell/Ada/Hopper 和 AMD CDNA3/4 代际,覆盖云厂商真实部署场景,结论更具参考价值。
端到端可验证:从模型加载、Serving、流量压测到功率计量全链路覆盖,结果直接服务采购决策和成本估算。
社区共建:任何人都可以通过提交 PR 修改基准测试配方(benchmark recipe),影响下一次自动化测试的配置。
需要清醒认识的是,InferenceX 不是一个普通开发者能轻松复现的项目。它需要:
普通开发者无法在本地复现其测试环境,但可以通过 https://inferencex.com/ 查看公开的实时结果,这是该项目最有价值的输出窗口。
在 AI 推理领域,供应商往往会挑选有利于自己的基准场景进行宣传。InferenceX 通过持续公开的测试体系,为整个行业提供了一个中立的参照系——这也是为什么 OpenAI VP of Infrastructure、vLLM 联合创始人、Flash Attention 作者都主动为其背书。
随着 AI 推理基础设施逐步成为主权级别的战略资源,InferenceX 这类透明基准测试平台的战略价值正变得越来越不可忽视。