turboquant

LLM 推理 KV Cache 极致压缩,3-bit Key + 2-bit Value 量化实现 4-5 倍显存节省

Stars1.8k
Forks195
主语言Python
分类模型部署与推理
作者0xSero
LicenseGPL-3.0

加载项目详情…