deltafin
本地运行 Kimi K3 大模型,单卡部署千亿参数开源模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地运行 Kimi K3 大模型,单卡部署千亿参数开源模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这个场景:你有一台 M1 Max MacBook Pro(64GB 统一内存),突然想在深夜调试一个大语言模型,但不想把数据发送到云端——不想让任何 API 密钥暴露在外,也不想被网络延迟卡住。Deltafin 就是为这种场景而生的:它让你在本地工作站上完整运行一个拥有 2.8 万亿参数的超大 MoE(混合专家)模型——Kimi K3,完全离线,完全私有。
大语言模型的参数规模每18个月增长约10倍,如今千亿参数模型已是常态,万亿参数模型也开始出现。按常理,运行这样的模型需要数据中心级别的算力——成百上千块 GPU 通过高速网络互联。但 Deltafin 的作者 gavamedia 偏要挑战这个常识:能否用"少数派"的技术路线,把万亿参数模型压缩到单台工作站里?
这个问题的答案藏在 MoE 架构中。Kimi K3 是一个混合专家模型(Mixture-of-Experts),每一层有16个独立的"专家"子网络,但在每次前向传播中,路由机制只会激活其中少数几个。对于2.8T总参数,实际参与每次推理的有效参数远小于此——这为"单卡运行"提供了理论可能。
Deltafin 的性能数据让人印象深刻:在 M1 Max(64GB,第一代机型)上,参考解码速度达到 0.266 token/s(即每 token 约 3.76 秒)。这不是最强硬件的测试结果,而是作者实测的"基准线",更新硬件还有提升空间。
Deltafin 的优化哲学非常清晰——速度不能以牺牲模型质量为代价。它保留了全部16个专家和完整的 K3 目标模型,对每个 token 精益求精。在此基础上,三大核心技术手段将运行效率推到极限:
MXFP4 量化:将专家权重压缩为4位浮点(MXFP4),显著减少显存占用,同时保持数值精度。这使得在有限显存中装下更多专家权重成为可能。
零拷贝 Metal 专家权重:在 Apple Silicon 平台上,Deltafin 将专家权重直接映射到 Metal 图形引擎,绕过 CPU 和 PyTorch 框架的开销。Metal MoE 路径用自定义 CUDA/Metal kernel 替代通用 GEMV 运算。
推测解码(Speculative Decoding):用一个小型 draft 模型预先生成候选 token,K3 仅负责验证和接受。实测中,推测解码显著提升了每秒 token 输出数。
这套优化体系还衍生出一个令人惊讶的副产品:Apple Silicon MPS 路径在某些场景下比 CUDA 更快。作者在 OPTIMIZATIONS.md 中详细记录了各硬件路径的交叉点和性能拐点,有大量基准测试数据支撑。
Deltafin 提供了完整的用户入口,没有陡峭的学习曲线:
方式一:命令行直接运行
安装完成后(venv + 依赖 + native 库 + 模型),一行命令即可对话:
./venv/bin/python tools/kimi_run.py --chat --prompt "用Python写一个快速排序"
加 --stats 参数还能实时显示 tok/s、s/token 和 draft 接受率等调试信息。
方式二:OpenAI 兼容 API 服务器
这是 Deltafin 最有生产价值的特性。启动本地 API 服务器后,所有支持 OpenAI 接口的工具(LangChain、chatbot-ui、Cline、Copilot 等)都能无缝接入:
./venv/bin/python tools/serve_openai.py --port 8000
# 然后在 OpenAI SDK 中设置 base_url 为 http://127.0.0.1:8000/v1
由于是本地部署,API 响应完全私密,没有任何数据外流。
方式三:Python 直接集成
Deltafin 提供了 pilot.py 等工具,可嵌入到 Python 应用中作为后端。tools/ 目录有完整的测试套件和性能分析工具。
尽管 Deltafin 把"不可能"变成了"可能",但它的部署难度不容低估:
Deltafin 代表了一种新兴趋势:在端侧运行超大参数模型。随着 MoE 架构、量化技术和硬件的快速进步,"一台机器跑万亿模型"正在从实验性项目走向可工程化部署。Deltafin 的价值不仅在于它能跑 Kimi K3,更在于它公开了完整的性能数据和优化路径,为整个社区提供了可复现的技术参考。
如果你在研究 MoE 模型推理优化、需要完全私有的本地 LLM 部署方案,或对 AI 系统的底层工程有浓厚兴趣,Deltafin 是一个值得深入研究的标杆项目。
仓库地址:https://github.com/gavamedia/deltafin
模型来源:https://huggingface.co/moonshotai/Kimi-K3
主要语言:Python
许可协议:NOASSERTION
主题标签:kimi, kimi-k3, local-ai, local-llm