KVQuant

通过 KV Cache 低比特量化,让 LLaMA-7B 在单张 A100 上实现百万级上下文推理的

Stars433
Forks48
主语言Python
分类模型部署与推理
作者SqueezeAILab
License

加载项目详情…