PowerInfer
稀疏激活推理引擎,消费级显卡上实现 llama.cpp 最高 11.69 倍加速
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
稀疏激活推理引擎,消费级显卡上实现 llama.cpp 最高 11.69 倍加速
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你手里只有一块 RTX 4090 显卡(游戏玩家标配),却想让一个参数量高达1750亿的大模型在本地流畅运行——这不是痴人说梦,PowerInfer 正在将它变成现实。2023年12月,上海交大 IPADS 实验室开源的这款推理引擎,在单张消费级 GPU 上实现了 llama.cpp 最高 11.69 倍的推理加速。
图1: PowerInfer 项目 Banner
大语言模型(LLM)的推理长期以来被认为是大厂专属游戏。Opt-175B、Falcon-40B 这样的庞然大物,理论上需要专业级 A100 GPU(售价约10万元人民币)才能流畅运行,个人开发者和小团队根本无力承担。 上海交通大学 IPADS 实验室的研究人员从神经元激活的稀疏性入手,发现了一个关键规律: LLM 中只有少数「热」神经元被反复激活,而大多数「冷」神经元因输入不同而变化。这一规律可以用幂律分布(Power-Law)来描述。PowerInfer 正是利用这种「激活局部性」(Activation Locality)来优化推理效率。 项目最初由上海交大团队开发,代码库托管于 Tiiny-AI 组织(上海交大 IPADS 实验室孵化),后续扩展了 SmallThinker 移动端推理(2025年7月)和 PowerInfer-2 智能手机推理(2024年6月),形成了完整的稀疏推理技术栈。2026年1月,团队还发布了 Tiiny AI Pocket Lab——一款口袋尺寸的超算设备,可在本地以 20 tokens/s 运行 120B 参数 int4 模型,并在 CES 2026 上亮相。
PowerInfer 的设计哲学可以用一句话概括: 把热数据放在 GPU 显存里快取,把冷数据交给 CPU 计算。具体来说:
图2: TurboSparse 技术 Banner根据项目论文和 benchmark,在单张 RTX 4090(24GB)上运行 Falcon(ReLU)-40B-FP16:
| 指标 | PowerInfer | llama.cpp | 提升幅度 |
|---|---|---|---|
| 平均生成速度 | 13.20 tokens/s | ~1.13 tokens/s | 10x+ |
| 峰值速度 | 29.08 tokens/s | ~2.5 tokens/s | 11.69x |
| 显存占用 | 18GB | 接近满载 | 更优 |
| 与专业级 A100 GPU(80GB)相比,PowerInfer 在 RTX 4090 上的性能仅低约18%,但成本是数量级的差距。 |
PowerInfer 支持多种主流稀疏模型架构:
编译安装(Linux + CUDA):
git clone https://github.com/Tiiny-AI/PowerInfer
cd PowerInfer
pip install -r requirements.txt
cmake -S . -B build -DLLAMA_CUBLAS=ON
cmake --build build --config Release
编译过程约10-20分钟(取决于机器配置)。生成的可执行文件 build/main 等效于 llama.cpp 的 main,用法几乎一致。
Docker 部署: 项目提供 CUDA/ROCm/CPU 多版本 Dockerfile,适合快速验证:
# CUDA 版本
docker build -f .devops/main-cuda.Dockerfile -t powerinfer:cuda .
# ROCm 版本(AMD GPU)
docker build -f .devops/main-rocm.Dockerfile -t powerinfer:rocm .
在线 Demo: 不想折腾的用户可以直接访问 PowerInfer Gradio Demo(部署在 Vercel),体验 Falcon(ReLU)-40B-FP16 的推理效果,无需本地部署。
硬件要求: 最低 RTX 3060(12GB)可运行 7B 模型,40B 模型推荐 RTX 4090(24GB)。无 GPU 时可纯 CPU 运行,但速度较慢。
图3: SmallThinker 移动端推理框架
PowerInfer 基于 llama.cpp 分支开发(C++ 编写),核心架构为模块化设计:
powerinfer/ 目录下实现稀疏矩阵乘法、CPU-GPU 调度、神经元预测器powerinfer-py/ 提供模型转换(支持 HuggingFace 模型转 GGUF),gguf-py/ 处理 GGUF 格式smallthinker/ 目录包含移动端推理框架和 Android 示例examples/ 包含 server(类 OpenAI API)、benchmark、batch inference 等
代码质量较高,有完整的 CI/CD(GitHub Actions)、clang-tidy 代码检查、code coverage 追踪,代码注释清晰。
图4: PowerInfer 稀疏矩阵乘法优化示意PowerInfer 并非银弹,存在以下局限:
PowerInfer 的出现打破了「大模型 = 天价服务器」的固有认知。通过稀疏激活和异构计算优化,它证明了在消费级硬件上高效运行大模型是可行的。 从增长曲线看,PowerInfer 获得了 9500+ GitHub Stars,项目影响力持续扩大。2024年6月发布的 PowerInfer-2 和 TurboSparse 将战场从 PC 拓展到智能手机,实现了 11.68 tokens/s 的移动端推理速度(TurboSparse-Mixtral-47B)。 这一方向代表了大模型推理的重要趋势: 从云端集中式部署向边缘端分布式推理演进。随着 Tiiny AI Pocket Lab 等硬件产品的推出,个人设备运行超大模型正在从概念走向产品化。