LightCompress
大模型压缩一站式工具箱,支持量化/剪枝/Token削减,覆盖 LLM/VLM/视频生成模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
大模型压缩一站式工具箱,支持量化/剪枝/Token削减,覆盖 LLM/VLM/视频生成模型
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你有一个功能强大的 AI 助手,却只能运行在服务器农场里,普通用户的手机和电脑根本带不动——这正是当前大模型(LLM/VLM)的真实困境。GPT-4、DeepSeek-V3 这样的模型体积动辄数百 GB,部署成本极高,严重制约了 AI 技术的普及。
LightCompress(项目原名 LLMC)正是为解决这一痛点而生。这是一个由 ModelTC 团队(来自上海人工智能实验室)打造的大模型压缩工具包,专注于将庞大的 AI 模型"瘦身"到可在消费级硬件上运行的程度,同时尽量保留原始模型的性能。

图1:LightCompress 项目头像
LightCompress 实现了业界最完整的模型压缩算法矩阵,覆盖大模型压缩的三大主流方向:
将模型权重从 FP32/BF16 压缩到 INT8/INT4,大幅降低显存占用和计算量。支持的量化算法包括:
移除对模型输出影响较小的权重连接,包括:
对视觉-语言模型(VLM),通过合并或删除冗余视觉 token 来降低推理计算量:
LightCompress 对主流大模型提供了开箱即用的压缩支持,堪称"模型压缩界的瑞士军刀":
| 模型类别 | 代表模型 | 压缩方式 |
|---|---|---|
| LLM(纯语言) | DeepSeek-V3/R1, Qwen2, Llama3, Mistral, Mixtral, InternLM2 | AWQ/GPTQ/RTN 量化、稀疏化 |
| VLM(视觉-语言) | Qwen2-VL, Llama3.2, DeepSeek-V2 | Token Reduction + 量化 |
| Video Generation | Wan2.1, CogVideoX | INT8/FP8 量化,支持导出 lightx2v |
| MoE(混合专家) | DeepSeek-V2/V3, Mixtral | 671B 参数 MoE 量化,单卡 80G 可跑 AWQ |
特别值得一提的是对 DeepSeek-V3(671B MoE) 的支持:用户可以直接加载 FP8 预训练权重,配合单卡 80G 显存完成 AWQ 和 RTN 量化,并导出 INT4/INT8 真实量化权重。这一能力在开源社区中处于绝对领先地位。
llmc/
├── compression/
│ ├── quantization/ # 量化算法(AWQ/GPTQ/SmoothQuant等20+算法)
│ ├── sparsification/ # 剪枝算法(Wanda/Magnitude/ShortGPT)
│ └── token_reduction/ # Token削减算法(FastV/DART/DyCoKe等)
├── configs/ # 227个配置文件,覆盖各模型和后端
├── examples/ # 使用示例
└── tools/ # 辅助工具(benchmark、eval等)
核心模块采用配置驱动的设计理念:用户无需编写 Python 代码,只需修改 YAML 配置文件即可对不同模型应用不同压缩策略。llmc/__main__.py 提供了统一的 CLI 入口,配置文件在 configs/ 目录下按模型和后端分层组织。
支持的推理后端包括:vLLM、AutoAWQ、SGLang、MLC-LLM 等主流推理框架,量化后的权重可直接导出使用。
LightCompress 提供了开箱即用的 Docker 镜像,彻底规避了依赖地狱问题:
# Docker Hub(国际用户)
docker pull llmcompression/llmc:pure-latest
# 阿里云(国内用户,强烈推荐)
docker pull registry.cn-hangzhou.aliyuncs.com/yongyang/llmcompression:pure-latest
镜像基于 CUDA 12.1/12.4 + cuDNN 8 + Python 3.11,内置了 flash-attention、fast-hadamard-transform 等核心依赖。Dockerfile 采用多阶段构建,最终镜像仅保留运行时依赖,体积可控。
本地构建则需要先准备好 PyTorch wheel 文件和 CUDA 环境,构建过程相对复杂(约 30 分钟),但提供了最大定制灵活性。
LightCompress 并非纯工程项目,而是有扎实学术支撑的工具包:
这意味着项目不仅实用,其算法设计也经过了学术同行的评审和验证。
客观来说,LightCompress 也存在一些局限:
LightCompress 代表了大模型压缩领域的工程化最佳实践——它不是简单封装一两种算法,而是系统性地覆盖了从 LLM 到 VLM、从量化到剪枝的全栈压缩方案。Docker 镜像的提供大幅降低了使用门槛,227 个配置文件表明团队在多模型支持上投入了大量精力。对于需要在边缘设备部署大模型、或优化推理成本的团队和个人开发者,这是一个值得深入研究的强力工具。
如果你关心的问题是:"如何让大模型在更小的硬件上跑得动且跑得好?"——LightCompress 就是目前开源社区里最接近这个问题的完整答案之一。