chitu
清华团队开源的多硬件统一大模型推理引擎,支持国产GPU和前沿量化技术
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
清华团队开源的多硬件统一大模型推理引擎,支持国产GPU和前沿量化技术
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年至2025年,大模型技术呈爆发式增长,以 DeepSeek-R1(671B 参数)、Qwen3、GLM-4.5 为代表的千亿参数模型带来了前所未有的能力跃升,但同时也将一个尖锐问题摆到了所有 AI 团队面前——如何在有限的 GPU 资源下高效、经济地运行这些庞然大物?
「赤兔」(Chitu)正是在这一背景下由清华大学团队正式推出的大模型推理框架。「赤兔」之名取自三国时期刘备的坐骑,寓意「日行千里、战力澎湃」——这恰恰也是该框架的设计目标:让超大参数模型在各种 GPU 硬件上跑得快、跑得稳。
赤兔项目最早可追溯至 2025 年初,彼时团队正面临 DeepSeek-R1 671B 模型在国产 GPU 上的部署挑战。随着版本迭代,赤兔逐步完善了对昇腾、英伟达、沐曦、海光、摩尔线程等主流硬件的适配,成为国内少有的多硬件统一推理方案。
赤兔最大的差异化特性在于其广泛的硬件支持。传统的 LLM 推理框架(如 vLLM)主要针对 NVIDIA GPU 优化,而赤兔从立项之初就将国产硬件列为核心目标。目前已正式支持的硬件平台包括:
这种「一套代码、多端运行」的能力,对于需要在国产化环境下部署 AI 能力的政企用户来说尤为关键。
赤兔在量化技术上的投入是其性能领先的核心。框架内置了十余种量化方案,包括:
这些量化技术让原本「吞卡巨兽」般的 671B 大模型,得以在消费级或准旗舰 GPU 上实现可接受的推理速度。
赤兔采用**张量并行(Tensor Parallelism)**架构,支持将大模型拆分到多卡乃至多机部署。调度器(scheduler)负责请求级别的负载均衡,支持 Continuous Batching 和 Prefix Caching,最大限度提升 GPU 利用率。v0.5.0 版本重点优化了集群部署场景的性能,吞吐量相比早期版本提升显著。
赤兔采用分层模块化设计,代码结构清晰:
chitu/attn_backend/:11 种注意力后端(FlashAttention、FlashInfer、FlashMLA、Triton、Hopper Mixed 等),根据硬件自动选择最优实现chitu/quantization/:22 种量化方案注册表,支持运行时自动选择chitu/serve/:基于 FastAPI 的 REST API 服务层,兼容 OpenAI API 格式chitu/distributed/:分布式推理通信层chitu/models/:支持的模型实现(DeepSeek、Qwen、GLM 等)项目使用 PyTorch 的 CUDAExtension 编译自定义 CUDA 算子,配合 Cython 加速关键路径,整体代码质量评分较高(88/100)。
虽然赤兔本质上是一个后端推理引擎,而非面向终端用户的 Web 应用,但它确实提供了服务化的访问能力:
chitu/serve/ 中包含完整的 REST API 服务(基于 FastAPI),兼容 OpenAI 的 /v1/chat/completions 接口gradio/、streamlit/、web/、ui/、dashboard/ 等子目录,表明项目预留了前端界面扩展能力(但当前版本可能仍处于开发阶段)官方推荐使用 Docker 镜像 进行部署,已发布针对不同硬件优化的官方镜像:
# NVIDIA GPU(计算力 8.0-8.9)
docker pull qingcheng-ai-cn-beijing.cr.volces.com/public/chitu-nvidia_arch_80_89:latest
# 昇腾 A2
docker pull qingcheng-ai-cn-beijing.cr.volces.com/public/chitu-ascend_a2:latest
不支持 docker-compose 一键集群部署,是当前版本的主要局限。
Chitu「赤兔」是国内高校团队在大模型推理领域的一次重要实践,其多硬件适配能力和前沿量化技术填补了国产化 AI 部署工具链的空白。对于需要在昇腾、沐曦等国产 GPU 上运行 DeepSeek、Qwen 等大模型的企业用户来说,赤兔是目前最值得关注的开源选择之一。