Chinese-Mixtral
基于Mixtral-8x7B的中文MoE大模型,460亿参数推理仅需13B算力,32K上下文原生支持
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于Mixtral-8x7B的中文MoE大模型,460亿参数推理仅需13B算力,32K上下文原生支持
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Chinese-Mixtral 项目封面图
2024年1月,Mistral AI 发布了一个让整个 AI 圈震动的开源模型——Mixtral-8x7B。这是一个稀疏混合专家模型(Mixture of Experts,MoE),在多项 benchmark 上逼近甚至超越 GPT-3.5,但推理成本却大幅降低。然而,这个强大的模型有一个致命缺陷:它几乎不懂中文。
原因很简单:Mixtral 的预训练语料以英文和欧洲语言为主,中文占比极低。这就导致一个尴尬的局面——用英文 prompt 它能写代码、做数学题、推理逻辑,但换成熟悉的中文问答,它就开始"中英混杂",甚至出现事实性错误。中文大模型社区对此并不陌生:LLaMA、Alpaca、MPT 等英文基础模型都面临同样的问题,解决方法也相对成熟——在原模型基础上,用大规模中文语料做增量预训练(Continual Pretraining),再通过指令微调(Instruction Tuning)提升对话能力。
Chinese-Mixtral 正是这一思路的延续。项目由东北大学 + 苏州知识工厂(HFL)联合开发(代表开发者 ymcui),在 Mixtral-8x7B-v0.1 的基础上,通过中文增量训练得到了一个真正"懂中文"的大模型。该项目在 GitHub 上获得 613 颗 Stars、43 个 Fork,在中文 LLM 生态中具有重要影响力。
要理解 Chinese-Mixtral 的技术优势,首先要理解它基于的 Mixtral 架构。与传统大模型(如 LLaMA)每个 token 都激活全部参数不同,Mixtral 引入了"专家路由"机制:
每个 Transformer 前馈层(FFN)包含 8 个独立的"专家"(每个专家本质上是一个全连接网络)。对于输入序列中的每个 token,路由器(Router)会预测应该激活哪 2 个专家来处理它。这意味着:虽然总参数量高达 460 亿,但每次推理时实际激活的参数量只有约 130 亿,相当于一个中等规模的小模型。
这一设计的直接好处是推理速度与 13B 模型相当,但模型容量却接近 47B。打个比方:如果把传统大模型比作一个"全才员工"处理所有任务,那么 MoE 就像是一个"专家会诊"——遇到编码问题调用编程专家,遇到数学问题调用数学专家,每次只出动最合适的两个人。
Chinese-Mixtral 继承了 Mixtral 的另一个重要特性——原生 32K 上下文窗口(实测可达 128K)。这比 Chinese-LLaMA-Alpaca 系列(最大 4K)有了质的飞跃。原生支持长上下文意味着模型在处理长文档分析、多轮对话、长代码审查等任务时,不需要复杂的上下文扩展技巧,效果更稳定。
Chinese-Mixtral 仓库结构清晰,主要包含以下模块:
| 目录/文件 | 说明 |
|---|---|
examples/ | 对话示例、多轮对话脚本 |
scripts/ | 训练、推理、评估、量化全流程脚本 |
scripts/training/ | 预训练和指令微调脚本 |
scripts/inference/ | 本地推理脚本 |
scripts/llamacpp/ | llama.cpp 量化部署脚本 |
scripts/openai_server_demo/ | OpenAI 兼容 API 服务脚本 |
scripts/ceval/ cmmlu/ mmlu/ | 标准化评测脚本 |
requirements.txt | 核心依赖:transformers, peft, torch, bitsandbytes |
项目的训练脚本展示了完整的 LLM 定制流程:
Chinese-Mixtral 在多项中文评测任务中展现了竞争力:
对于没有高端 GPU 的用户,项目提供了极具价值的本地量化部署方案。使用 llama.cpp 进行 INT4 量化推理:
此外,项目还提供了 OpenAI 兼容 API 服务脚本,将 Chinese-Mixtral 封装成 OpenAI API 格式,现有基于 LangChain、privateGPT 等工具可以直接切换使用。
Chinese-Mixtral 经历了多次版本迭代,v1.0 到 v1.2 增加了量化版本、OpenAI API 支持等功能。但对于新用户而言,如何选择合适的模型版本、如何正确配置推理环境,仍然存在一定门槛。项目虽然提供了详细文档,但缺少一键部署脚本。
稀疏 MoE 架构虽然高效,但也带来了"专家负载不均衡"的问题——某些专家被频繁激活,而另一些可能长期闲置。这导致 MoE 模型在特定任务上的表现不如同参数量的密集模型(Dense Model)稳定。Chinese-Mixtral 在中文任务上的长尾覆盖能力仍有提升空间。
2024年4月,同一团队发布了 Chinese-LLaMA-Alpaca-3(基于 Llama-3),提供了 8B 规模的更轻量选择。对于只需要基础中文对话能力的用户,Chinese-Mixtral 的 46.7B 参数量显得有些"重"。
Chinese-Mixtral 的价值不仅在于它本身是一个可用的中文大模型,更在于它展示了中文 LLM 社区快速跟进国际前沿技术的能力。从 Mixtral 发布(2024年1月)到 Chinese-Mixtral 开源(2024年1月底),只用了不到一个月。
从技术演进角度看,Chinese-Mixtral 验证了以下趋势:
对于 AI 研究者和开发者而言,Chinese-Mixtral 仓库提供了从预训练到微调、从量化到部署的全套参考代码,是一个优质的学习和二次开发起点。