ktransformers
CPU-GPU异构计算框架,让消费级GPU也能高效运行671B参数大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
CPU-GPU异构计算框架,让消费级GPU也能高效运行671B参数大模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你的台式机上只有一块 24GB 显存的 RTX 4090,按照常识根本跑不动 671B 参数的 DeepSeek-R1。但如果用 KTransformers,这台「普通电脑」居然能跑出每秒十几 token 的速度——不是 PPT 演示,而是真实可复现的数字。
这个项目正在做的事情,本质上是在解决大语言模型落地最核心的矛盾:硬件成本与模型规模的鸿沟。
大模型的参数规模直接决定了硬件需求。以 DeepSeek-R1(671B 参数)为例,业界通常认为至少需要 8 张 A100-80GB(640GB VRAM)才能跑起来,折算下来光 GPU 成本就超过 50 万元人民币。但 KTransformers 团队发现了一个关键规律:
主流大模型普遍采用 MoE(Mixture of Experts)架构,每次前向传播只激活部分专家网络。以 DeepSeek-V2 为例,21B 激活参数的模型实际只需要约 21GB 显存——这个数字 4090 刚好够。剩余的「沉默参数」完全可以卸载到内存(RAM)或甚至硬盘上,通过异构计算调度来弥补带宽差距。
这一洞察成为了 KTransformers 的技术起点:不是让硬件迁就模型,而是让模型「适应」现有硬件。
KTransformers 的核心设计理念是 CPU-GPU 异构推理:让 GPU 专注处理计算密集的激活参数,将占显存大头的「专家参数」动态分配到 CPU 内存和磁盘。整个系统的性能瓶颈从显存容量转移到了内存带宽和 CPU 计算能力上——这两个维度,消费级硬件反而有优势。
kt-kernel 子模块是整个项目的性能引擎,实现了多种针对 CPU 的高性能计算后端:
所有后端均支持 NUMA 感知执行,在多路 CPU 服务器上自动识别 NUMA 拓扑,将线程和内存绑定到同一节点,避免跨节点内存访问造成的延迟惩罚。
除了推理,KTransformers 还支持 Supervised Fine-Tuning(SFT)微调能力。通过与 LLaMA-Factory 的深度集成,用户可以在 KTransformers 加速的硬件配置上进行模型微调。支持的微调方法包括 LoRA / QLoRA(低秩适配微调)、DPO(直接偏好优化)以及 RL-DPO(结合强化学习的偏好优化)。
在推理服务化方面,KTransformers 已完成与 SGLang 的集成。SGLang 是目前最流行的 LLM 推理服务框架之一,支持 continuous batching、prefix caching 等高级调度特性。集成后,KTransformers 的加速能力可以直接在 SGLang 的服务框架下使用,降低了生产部署的复杂度。
KTransformers 的模型支持列表堪称国产大模型的「全家福」:
| 模型 | 类型 | 支持情况 |
|---|---|---|
| DeepSeek-V3 / R1 | MoE | 完整支持,24GB VRAM 可跑 |
| Kimi-K2 / K2.5 / K2-Thinking | MoE | Day0 支持 |
| GLM-4 / GLM-4-MoE / GLM-5 | MoE | 完整支持 |
| Qwen3-30B-A3B | MoE | 完整支持 |
| MiniMax-M2.1 / M2.5 | MoE | 原生支持 |
| LLaMA 4 | MoE | 实验性支持 |
| SmallThinker | MoE | 完整支持 |
从支持列表可以看出,项目对国产大模型的跟进速度极快——几乎是模型发布后数日之内就提供 Day0 支持,这需要团队对各模型的架构细节有深入理解。
硬件需求分两档:
最低配置(纯 CPU 推理):一台支持 AVX2 的普通 x86 服务器即可,理论上不需要任何 GPU。项目还提供了 llamafile 后端来支持 GGUF 格式模型,适合完全不想碰 GPU 的用户。
推荐配置(GPU 加速推理):一块 24GB 以上显存的 NVIDIA 显卡(RTX 4090、A5000 等),配合 32GB+ 内存。根据项目实测,RTX 4090 跑 DeepSeek-R1 可达 12-16 tokens/s。
安装方式有三种:
pip install kt-kernel,自动检测 CPU 指令集并加载最优内核,预编译 wheel 覆盖 Python 3.10-3.12,Linux x86_64,无需编译。不支持 Windows/macOS,这是因为 CPU 优化内核高度依赖 Linux 特有的 hwloc 库和 NUMA 拓扑感知。
项目并非没有争议。最大的质疑在于:CPU-GPU 异构调度的延迟是否真的可接受? 在内存带宽远低于显存带宽的情况下,专家参数的切换会带来额外的延迟开销。对于延迟敏感的生产场景(如在线推理服务),这种架构可能不如纯 GPU 部署。KTransformers 团队也承认这一点,项目的定位更多是「让大模型在消费级硬件上可用」,而非「替代专业推理集群」。
其次,项目需要用户对模型格式有一定了解——主要使用 safetensors 和 GGUF 格式,MoE 专家分配需要特定的量化工具链,入门门槛不低。项目虽提供了 KT-CLI 工具来简化操作,但目前仍在活跃开发中。
KTransformers 的价值不仅在于技术本身,更在于它代表了一种趋势:打破大模型算力的中心化。当模型的推理成本从需要专业集群降低到一块消费级显卡甚至一台服务器,大模型的应用场景会被显著拓宽。
从数据来看,项目在 GitHub 上已有超过 17000 颗 star,这个数字背后是大量开发者和 AI 爱好者的关注。项目同时活跃于学术会议(GOSIM Paris 2026 "Agentic AI on Edge" track)和工业界落地(已集成到 SGLang 生态),说明其在研究和应用两条路上都有存在感。
如果你正在寻找一种低成本运行国产大模型的方案,KTransformers 值得认真了解。它不是银弹,但对于手头只有消费级硬件的团队来说,它可能是目前最接近「开箱即用」的选择。