local-llm
本地运行大模型的完整知识手册与实践指南
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地运行大模型的完整知识手册与实践指南
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
当 OpenAI 的 CEO 们一次次说出"AGI 就在眼前"却收着每千 token 几毛钱的费用,当你的 API 调用账单悄悄爬到每月几百美元,你有没有那么一瞬间想过——如果能有一台自己的大模型服务器,所有数据留在本地,想怎么问就怎么问,还不用担心隐私泄露,那该多好?
但现实是:本地跑大模型,门槛高得离谱。GPU 显存不够、推理速度太慢、多卡并行配置复杂到让人想放弃。网上的教程要么过时,要么只教你"pip install ollama"然后戛然而止,没有人在意你那两块 RTX 3090 到底该怎么组网、怎么调参、怎么让它跑出官方案例里一半的水平。
jamesob 就是在这个背景下,把自己的整台机器、全部踩坑经验、所有的配置文件,一股脑开源了出来。
初看 local-llm 这个仓库,你可能会有点困惑:它看起来不像一个"软件项目",更像一本超级详细的笔记。根目录只有 4 个条目:README、images、runners、tools,没有核心代码,没有 Python 框架,只有一个超过 9000 字的 README 详细记录了从硬件选购到软件配置的每一个细节。
这正是它的价值所在。
作者花了几十万美元,亲自买硬件、搭系统、调 BIOS、配 NCCL,趟过了几乎所有可能踩的坑,最后把所有经验浓缩成了这份指南。README 的第一句话就直白地写:
"Note: nothing in this README aside from the tables was written by AI."
这份文档的每一个字,都是人写的。
local-llm 为不同预算的玩家提供了清晰的硬件路径,每一条路都对应着可运行的模型规模和能力上限。
这个档次的推荐配置是两片 RTX 3090(每片 24GB),总显存 48GB。足够运行 Qwen3.6-27B,这是目前开源社区评价极高的中尺寸模型,能力接近 GPT-4o Mini 水平,推理速度也相当不错。同时还能跑 whisper-large-v3 或 cohere-transcribe 做本地语音转文字,11GB 显存就够了。
这个配置适合 AI 爱好者、有一定动手能力的技术人员,或者是担心隐私不想把数据送上云端的开发者。
这是作者实际在用的配置。4 张 NVIDIA RTX PRO 6000 Blackwell 工作站显卡,每张 96GB,总显存 384GB。
384GB 是什么概念?意味着可以在本地跑一个 594B 参数量(Int8 量化)的模型——作者实测的 GLM-5.2-Int8Mix-NVFP4-REAP-594B,在 4 卡张量并行下,推理速度约 80 tokens/s,上下文窗口支持 153K tokens,几乎可以装下一整部《战争与和平》。
作者的原话是:"At this level, you get the next step up in model intelligence. Something pretty close to Claude Opus."(达到这个水平,你的模型智能基本接近 Claude Opus 了。)
这套配置里最"反常识"的一个选择是用 PCIe Gen4 交换机(c-payne.com 产品)代替升级到 PCIe 5 主板和 DDR5 内存。
原因很直接:显卡之间的 P2P 通信(多卡推理时的 allreduce 步骤)才是瓶颈,而不是 CPU 和 GPU 之间的带宽。PCIe Gen4 交换机让 4 张 GPU 之间以 27.5 GB/s 单向 / 50.4 GB/s 双向 的速度直连,延迟低至 0.45 微秒——这已经是 Gen4 的线速极限了。
这样一来,省下了约 $10,000 的主板和内存成本,把钱全部花在刀刃(GPU)上。

runners/ 目录下提供了三个开箱即用的 docker-compose 配置,均基于 vLLM(voipmonitor 的 eldritch fork 定制版,针对 Blackwell 架构优化):
| Runner | 用途 | 上下文长度 | 推理速度 |
|---|---|---|---|
| GLM-5.2-594B | 主模型推理(4卡) | ~153K tokens | ~80 t/s |
| GLM-5.2-hybrid | 混合推理 | — | — |
| STT | 语音转文字(11GB VRAM) | — | — |
以 GLM-5.2-594B 的 docker-compose 为例,背后是一长串经过深度调优的 vLLM 参数:
这些参数不是随便设的,每一行背后都对应着一次(或多次)benchmark 和踩坑经历。
runners/stt/ 提供了基于 cohere-transcribe-03-2026 的本地语音转文字方案。相比在线 API,本地 STT 有两个关键优势:
只需要约 11GB VRAM,就能跑出接近 SOTA 的转录质量。
多卡 GPU 系统最常出问题的不是软件,而是 BIOS。作者在 README 里用了整整一节来记录 BIOS 配置细节:
lspci 显示 Gen1 的吓人数字,禁用 ASPM 后恢复正常这还只是开始。
多卡 P2P 训练中,NCCL 是负责 GPU 之间同步的通信库,但它和 Linux IOMMU 有冲突。解决方案是 grub 参数加一行 iommu=off,否则 NCCL 会无限期挂起。
PCI Express Access Control Services(ACS)默认开启时,会把 P2P 流量强制路由到 CPU 根端口,完全绕过 PCIe 交换机,让你的多卡加速变成笑话。解决方法是写一个脚本在每次启动时用 setpci 关闭 ACS——这需要 root 权限和一个 systemd oneshot 服务。
坦诚地说,local-llm 的局限非常明显:
硬件门槛极高。$40,000 不是一个小数目。即使是入门级的 $2,000 配置,也需要一定的技术能力来组装和调参。docker-compose 文件是为特定硬件环境写的,不能"下载就跑"。
没有 Web UI。整个项目是纯命令行的,SSH 进去操作。对于希望图形界面即点即用的用户,这直接劝退。
高度定制化。README 里花了大量篇幅讨论 BIOS 参数、PCIe 交换机配置、redriver gain 电平等,这些内容对普通开发者来说既陌生又关键。配置稍有不同,效果可能天差地别。
模型版权风险。GLM-5.2 是国产模型,部署前需确认许可证。Qwen 系列相对宽松,但仍需核查具体版本的授权条款。
维护状态。这是一个个人维护的项目,作者的硬件配置、BIOS 版本、驱动版本都写死在文档里,随着硬件和驱动更新,部分内容可能过时。
从更宏观的视角看,local-llm 的存在本身就有象征意义。
当 OpenAI、Anthropic、Google 轮流发布新模型、一次次涨价、一次次限制 API 用途的时候,有人在认真研究怎么把最强的模型跑在自己的机器上。1829 个 GitHub star 说明这个需求不是小众的——大量开发者和 AI 爱好者对"AI 自主可控"有真实的渴望。
从技术上看,这个项目也是 RTX 6000 Pro 生态系统的重要实验场。作者推荐的 rtx6kpro repo 和 c-payne 的 PCIe 交换机,正在被 Discord 社区里的数百名硬核玩家验证和迭代。
一句话总结:local-llm 不是代码库,而是一部关于本地大模型部署的硬核实战手册——它记录了从显卡选购到 BIOS 调参、从 docker-compose 配置到 NCCL 优化的全流程,适合愿意投入时间和金钱、对 AI 自主可控有强烈需求的深度用户。