TurboLLM
本地LLM引擎,自动GPU调优
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地LLM引擎,自动GPU调优
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

"你有没有这种感觉——每次想用本地大模型,光是配环境、调参数就花掉半小时,跑起来还不知道实际速度到底是多少?TurboLLM 就是来解决这个问题的。"
这是一位叫 Mohit Soni 的独立开发者,在折腾了无数次 llama.cpp 编译、LM Studio 配置、Ollama 调参之后,决定自己动手写的一个工具。2024 年底正式发布,至今已收获 227 个 GitHub Stars,npm 包周下载量持续攀升。
市面上的本地 LLM 工具普遍存在两个痛点。
第一个:引擎被锁死。 LM Studio 捆绑了一套固定的 llama.cpp 运行时,Ollama 直接把引擎藏进黑盒。想用社区最新的量化格式、最前沿的推理优化(如 Speculative Decoding、Low-bit KV Cache)?对不起,要么自己编译,要么等官方集成。这个等待周期可能是几周,也可能永远不来。
第二个:速度是个谜。 -ngl、--n-cpu-moe、-c、--threads……这些启动参数排列组合起来有几十种配置,哪种最快?没人告诉你。工具界面上的"速度"往往只是个理论值,不是你机器上的实测数据。
TurboLLM 正是针对这两个问题而生的。
TurboLLM 的设计哲学很简单:不要替用户做选择,把最好的选项交到用户手里。
这是 TurboLLM 的核心卖点。你可以把任意 llama-server 兼容二进制文件指向它——可以是官方 llama.cpp、可以是社区 Fork(比如 TurboQuant),也可以是你自己编译的版本。TurboLLM 会探测该引擎的实际能力,并动态调整 UI 展示。
这意味着你可以用上其他工具根本加载不了的 Fork。TurboLLM 官方推荐的 TurboQuant Fork,使用低比特 turbo4 KV Cache,在保持 q8_0 级别质量的同时,速度提升 2.2 倍(实测 RTX 5070 Ti 16GB,Qwen3.6-27B 模型)。

TurboLLM 在每次加载模型时,会在你的实际硬件上跑基准测试,实时测量并记住每个模型的真实生成速度。你看到的是"我的机器上,这个模型每秒能跑多少 token",不是出厂预设值。
与 LM Studio 的同机型同模型对比数据(RTX 5070 Ti 16GB,Qwen3.6-35B-A3B,200K 上下文):
| 配置 | TurboLLM | LM Studio | 提升 |
|---|---|---|---|
| 官方 llama.cpp q4_0 | 74.7 t/s | 61.0 t/s | 1.2× |
| 官方 llama.cpp q8_0 | 72.3 t/s | ~66 t/s | 1.1× |
| TurboQuant turbo4 | 24.6 t/s | 11.4 t/s | 2.2× |
Prefill 速度同样亮眼:TurboQuant Fork 在相同测试中达到 1288 tok/s,比 LM Studio 的 757 tok/s 快 1.7 倍。
TurboLLM 会在模型加载时自动探测 GPU 型号和显存容量,结合模型参数推荐最优的 Offload 配置,并在界面上显示"显存是否足够"的预判。用户在加载模型之前就能知道这个配置能不能跑、会不会爆显存,而不是等到跑一半才发现。
TurboLLM 整个技术栈非常干净:Node.js(TypeScript)后端 + React 前端 + Zustand 状态管理,没有 Electron,没有 Python。
架构上分为两层:
后端依赖两个关键包:@earendil-works/pi-ai(PI AI Agent 框架)和 @earendil-works/pi-coding-agent(编码 Agent),这解释了为什么 TurboLLM 能天然支持 Claude Code 等 AI 编程工具作为客户端。
推理后端实际上是 llama.cpp(或其 Fork),TurboLLM 自身不实现推理,而是作为引擎的编排层(Orchestration Layer)。

最简启动方式:
npx turbollm
执行后,TurboLLM 会:
http://localhost:6996Docker 部署同样友好:提供了 docker-compose-nvidia.yaml(NVIDIA GPU)和 docker-compose-amd.yaml(AMD ROCm),一条 docker compose up 即可。

TurboLLM 同时暴露 OpenAI 兼容 API 和 Anthropic 兼容 API,这意味着 Claude Code、Cursor、Windsurf 等工具,无需任何配置修改,直接将 ANTHROPIC_API_KEY 指向本地 TurboLLM 实例,就能在你自己的 GPU 上跑 Claude Code——完全离线,数据不出本机。
TurboLLM 强调"离线优先",不需要账号、不需要云端。但需要注意的是:默认情况下,遥测是开启的(使用统计 + 基准测试数据 + 崩溃报告)。用户可在设置中随时关闭,且每次关闭操作都有明确的界面提示。
这个设计在社区引发了一些讨论:一方面,开发者需要这些真实硬件数据来迭代产品;另一方面,用户对"数据外传"的边界感越来越强。如果你对隐私要求极高,记得首次启动后去 Settings 关掉遥测。
TurboLLM 并不适合所有人:
TurboLLM 的出现代表了一种新的思路:本地 LLM 工具应该做编排层,而不是绑定单一引擎。
随着 llama.cpp 社区 Fork 越来越多(TurboQuant、M剪枝量化、S厂优化版……),谁能最快用上这些前沿优化,谁就有速度优势。TurboLLM 把这个能力直接交到用户手里,而不需要编译、打 patch、等官方版本。
同时,"实测速度"这个理念也在影响行业——用户不再需要凭感觉猜速度,而是有了一个透明、可对比的基准。
| 维度 | 评价 |
|---|---|
| 速度优化 | ★★★★★ — 同机型比 LM Studio 快 1.2-2.2 倍 |
| 引擎灵活性 | ★★★★★ — 支持任意 llama-server Fork |
| 部署难度 | ★★★★☆ — npx 一键 / Docker 一键 |
| 技术栈 | ★★★★☆ — Node.js + React,无 Electron/Python |
| License | ★★★☆☆ — FSL-1.1(非完全开源) |
| 隐私 | ★★★☆☆ — 默认遥测开启,需手动关闭 |
适合人群: 有较强 GPU、追求推理速度上限、想用最新社区优化的进阶用户;需要让 AI 编程工具完全离线运行、对数据隐私有要求的开发者。
不适合: 显存 8GB 以下的用户;希望一键安装零配置的轻度用户;必须用 Ollama 模型库的用户。
