tokenspeed
光速级 LLM 推理引擎,极速 token 生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
光速级 LLM 推理引擎,极速 token 生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

2026 年,Claude Code、Cursor、Copilot 等 AI Coding Agent 已经深度融入软件工程师的日常工作中。这些 Agent 在处理复杂任务时,一个请求就能生成数万 token——远超传统对话场景几个量级。当 Agent 从「对话助手」进化为「代码工厂」,传统的 LLM 推理引擎开始暴露严重的吞吐量瓶颈。
想象一个真实的开发场景:你的 Cursor Agent 正在帮你重构一个 3000 行的模块,每次 keystroke 触发一次推理,平均需要 200 毫秒才能生成下一个 token。在一个 8 小时工作日中,单个 Developer 的 Agent 请求就可能消耗 50 万到 100 万个 token。如果你的团队有 100 名工程师同时使用 Agent,每月 token 消耗轻松突破数亿级别。此时,GPU 资源的消耗和推理成本就成为决定业务能否规模化的核心变量。
TensorRT-LLM 是 NVIDIA 官方的性能标杆,但它的上手门槛极高——需要深入理解并行策略、手写通信逻辑、适配新模型需要大量 CUDA 内核工程。vLLM 则是易用性的代表,但性能往往落后 TensorRT-LLM 10%-20%。有没有可能在不牺牲易用性的前提下,达到甚至超越 TensorRT-LLM 的性能?
这就是 TokenSpeed 诞生的背景。
TokenSpeed 由 LightSeek Foundation 开发,2026 年 5 月正式开源,2026 年 8 月加入 PyTorch 生态系统大家庭。它的核心理念是:第一个将控制平面(Control Plane)与执行平面(Execution Plane)完全分离的 LLM 推理引擎。
控制平面由 C++ 实现,负责:
执行平面由 Python 实现,负责:
PyTorch 官方博客在收录 TokenSpeed 时特别指出,这种架构「在核心调度系统中提供了强正确性保证,同时保留了高级执行层的开发效率」。
TokenSpeed 将 Kernel 视为一等公民,从核心引擎中完全解耦。它设计了一套可移植的公开 API、中心化注册表和可扩展插件机制,支持异构加速器。
最亮眼的成就是 TokenSpeed MLA(Multi-head Latent Attention)内核——这是 NVIDIA Blackwell 平台上最快的 MLA 实现之一,其 Decode 内核将查询序列长度合并到 head 维度以充分利用 Tensor Cores,性能大幅领先 TensorRT-LLM。这个 MLA 内核已经被 vLLM 官方采纳(PR #41778),足见其工程质量和影响力。
TokenSpeed 还支持多种注意力机制和 MoE 优化:
TokenSpeed 的性能数据令人印象深刻:
性能提升背后的核心技术包括:
TokenSpeed 提供 OpenAI 兼容 API,无需修改客户端代码即可接入:
tokenspeed serve openai/gpt-oss-20b \
--host 0.0.0.0 \
--port 8000 \
--tensor-parallel-size 1
部署流程遵循「配方模式」:
支持的硬件平台:
TokenSpeed 并非没有局限性:
TokenSpeed 的出现代表了一个重要趋势:推理引擎正在从「性能 vs 易用性」的二元对立走向融合。它用 C++ 控制平面保证关键路径的正确性和性能,用 Python 执行平面保留迭代速度和生态兼容性。
更重要的是,TokenSpeed 被 PyTorch 官方纳入生态系统,其 MLA 内核被 vLLM 采纳,显示出开源社区正在形成围绕推理优化的合力。当推理成本成为 AI Agent 规模化的关键瓶颈,类似 TokenSpeed 这样的专用推理引擎将扮演越来越重要的角色。
增长数据:项目 GitHub 已有 2063 Stars,271 Forks,上线后持续保持活跃更新,与 DeepSeek、Qwen、Moonshot 等主流模型团队保持深度合作。