deepcompressor
MIT开源的大模型/Diffusion模型量化压缩工具箱,支持INT4/INT8/FP4多种精度,包
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
MIT开源的大模型/Diffusion模型量化压缩工具箱,支持INT4/INT8/FP4多种精度,包
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你有一台顶配游戏电脑,显存 24GB,想跑一个 FLUX.1-dev 图像生成模型——结果模型权重 30GB,光加载就爆显存。这不是你的问题,是整个 AI 行业面临的共同困境:模型越训越大,消费级硬件越来越跑不动。
MIT HAN Lab(韩松团队)推出的 DeepCompressor 正是为解决这一问题而生。这是一个专注于大语言模型(LLM)和 Diffusion 模型压缩的开源工具箱,核心能力是将 BF16/FP16 的高精度模型压缩到 INT4/INT8 甚至 FP4,同时尽量保持模型精度不掉太多。
该项目的学术背景非常扎实:其核心算法 SVDQuant 发表于 ICLR 2025(Spotlight),QoQ 发表于 MLSys 2025,QServe 还被 NVIDIA 官方集成进 TensorRT-LLM。这意味着它不是纸上谈兵,而是经过顶会验证的工业级研究成果。
DeepCompressor 的代码架构分为两大部分,分别对应两类模型:
LLM 量化模块(deepcompressor/app/llm/):
Diffusion 量化模块(deepcompressor/app/diffusion/):
项目使用 omni-CONFIG 配置系统(基于 dataclass),通过 YAML 文件管理量化参数,支持命令行参数覆盖,兼顾灵活性与可复现性。核心依赖包括 PyTorch 2.5+、transformers 4.46+、diffusers 0.32+、bitsandbytes 等主流 ML 库。
Diffusion 模型量化的难点在于:权重和激活值都高度敏感,传统的后训练量化方法(如 SmoothQuant)只针对一边优化,在 4-bit 场景下捉襟见肘。SVDQuant 提出的核心思路是「低秩吸收」——将激活值中的异常值通过奇异值分解(SVD)转移到低精度权重分支,然后用高精度低秩分支处理剩余的异常值,两侧同时降低量化难度。
但这引入了一个新问题:低秩分支独立运行会引入额外的激活值内存访问,反而拖慢推理速度。为此,团队设计了 Nunchaku 推理引擎,核心优化是将低秩分支的算子融合进低比特分支的 CUDA kernel,从根本上消除了额外内存访问。实测在 RTX 4090 笔记本 GPU 上,FLUX.1 12B 模型内存占用降低 3.5 倍,推理速度比 4-bit 纯权重量化基线快 3 倍。
现有的 INT4 量化方案在边缘/单机场景表现尚可,但到了大批量云端服务就「趴窝」了——原因在于 GPU 反量化权重或部分和的操作会产生 20%~90% 的运行时开销,吃掉了量化的加速收益。QServe 从 CUDA 核心效率出发,设计了渐进式量化(Progressive Quantization)策略,配合计算感知的权重重排序和寄存器级并行化,使得 Llama-3-8B 在 A100 上的吞吐量提升 1.2 倍,Qwen1.5-72B 在 L40S 上提升 3.5 倍(对比 TensorRT-LLM)。
DeepCompressor 是一个纯研究导向的工具包,没有 Docker 支持,也没有 Web 界面。安装方式为 conda env create -f environment.yml 搭配 poetry install,依赖项较重(torch >= 2.5、transformers >= 4.46 等)。最低硬件需求为 8GB+ 显存的 NVIDIA GPU,更推荐 16GB+ 以支持大模型量化实验。
上手门槛主要集中在两点:理解量化配置(YAML 层级结构、量化位宽选择)和准备原始模型权重(需自行从 HuggingFace 下载)。不过文档质量较高,README 中每个算法都配有详细说明和对比数据。
DeepCompressor 体现了大模型压缩领域的两个重要趋势:一是从「单模态量化」(只量 LLM)向「跨模态量化」(LLM + Diffusion 统一框架)演进;二是从「精度优先」向「精度-效率联合优化」转变,在 INT4 级别已经能实现接近 BF16 的生成质量。
局限性方面:当前版本不支持动态量化(训练中量化),对自定义模型架构的适配需要一定的代码改造能力,文档以英文为主。另外由于使用了 bitsandbytes 等库,NVIDIA GPU 是硬性要求,AMD ROCm 或 CPU 推理暂不支持。
总体而言,DeepCompressor 是目前最全面的开源大模型压缩工具箱之一,学术价值高,工程可用性强,适合 AI 研究者和 ML 工程师了解和试用。