ChatGLM2-6B
清华NLP实验室与智谱AI开源的双语对话大模型,62亿参数支持本地部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
清华NLP实验室与智谱AI开源的双语对话大模型,62亿参数支持本地部署
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你有一个中文功底深厚的AI助手——它既能和你流畅地聊技术话题,又能帮你分析一段复杂的长文档,还能在几秒钟内解出一道数学推理题。2023年6月,清华大学NLP实验室与智谱AI联合发布的 ChatGLM2-6B,正是这样一款让普通开发者也能在本地运行的强力双语对话模型。它以62亿参数的身量,在多项评测中逼近GPT-4的表现,成为了开源社区最受欢迎的中文大模型之一。
ChatGLM2-6B 由 THUDM(Tsinghua Huidian Magic,清华智谱) 团队开发,该团队同时也是 GLM(General Language Model)通用语言模型架构的提出者。团队核心成员来自清华大学自然语言处理与社会人文计算实验室(THUNLP),在语言模型领域已有多年积累。2020年发布的中英文预训练模型 GLM-130B,是当时少有的千亿参数开源双语模型;2023年初推出初代 ChatGLM-6B 后,仅6个月便迭代至第二代,技术迭代速度令人瞩目。
智谱AI(Zhipu AI)作为背后的产业化力量,已发展为国内头部大模型公司,其 GLM 系列模型在企业市场有广泛应用。开源 ChatGLM2-6B 的目的,既是回馈社区,也是收集真实使用反馈以反哺商业模型的战略举措。
ChatGLM2-6B 的底层架构基于团队自研的 GLM(General Language Model) ,这是一种融合了自回归、自编码和编码-解码三种预训练目标的统一框架,与 GPT(纯自回归)、BERT(纯自编码)均有本质区别。简单类比:如果说 BERT 是一位"完形填空高手",GPT 是一位"续写大师",那么 GLM 则是一位"既能完形填空、又能续写、还能翻译的全能选手"。
第二代相比初代的核心改进是引入了 Multi-Query Attention(MQA) 技术。传统Transformer使用Multi-Head Attention(MHA),每个注意力头都有独立的 Query、Key、Value 矩阵,导致 KV Cache 显存占用巨大。MQA 让所有注意力头共享同一套 Key 和 Value,大幅压缩了推理时的显存占用——实测推理速度提升约42%,INT4量化下单张6GB显存的显卡可生成8000+字符的对话(初代仅能生成约1000字符)。
1. Web UI 对话(推荐尝鲜)
运行 web_demo.py 后,Gradio 会启动一个本地 Web 服务,在浏览器中即可体验对话界面。界面支持 Markdown 渲染、数学公式显示、代码高亮,对话体验接近 ChatGPT。

图1:ChatGLM2-6B Web UI 对话界面
2. 命令行对话
运行 cli_demo.py,在终端中直接对话,无需任何 Web 服务,适合远程服务器场景。

图2:ChatGLM2-6B 命令行对话界面
3. REST API 服务
运行 api.py,会启动一个 FastAPI 服务(默认端口8000),提供 OpenAI 兼容格式的对话接口,便于集成到现有应用。
数学推理:GSM8K 提升571%
初代 ChatGLM-6B 在 GSM8K 数学数据集上的准确率仅为 4.82%,基本无法正确解答小学数学题。ChatGLM2-6B 将这一数字提升至 28.05%,虽然与 GPT-4(67%左右)仍有差距,但已是质的飞跃。

图3:ChatGLM2-6B 数学推理示例
中文知识:C-Eval 达50.1%
C-Eval 是最权威的中文知识评测基准,ChatGLM2-6B 在开发集上达到 50.1%,超越初代 38.9%,在同尺寸开源模型中处于领先水平。

图4:ChatGLM2-6B 知识推理示例
长文档理解:32K 上下文版本
对于需要处理长文档的场景,团队还发布了专门的 ChatGLM2-6B-32K 版本,上下文长度从 2K 扩展到 32K,在 LongBench 长文本评测中表现突出,可轻松完成一篇论文的摘要提取或一本书的章节分析。
推理速度:42% 提升
Multi-Query Attention 的引入让生成2000字符的推理速度从31.49字符/秒提升至44.62字符/秒,用户在对话时会感受到明显的"跟手"感提升。
ChatGLM2-6B 提供了多种精度模式,不同模式对硬件要求差异巨大:
| 量化等级 | 生成8192字符最小显存 | 适用场景 |
|---|---|---|
| BF16/FP16 | 12.8GB | 研究/高精度场景 |
| INT8 | 8.1GB | RTX 3060Ti 以上 |
| INT4 | 5.1GB | RTX 3060 / M1 Pro 以上 |
一块 RTX 3060Ti(8GB显存)即可流畅运行 INT8 量化版本,而 RTX 4060 Ti 16GB 则可以运行完整的 BF16 版本。CPU 推理虽然可行,但速度极慢(可能只有几 token/秒),不建议生产环境使用。
社区也涌现了多个加速方案:
1. 幻觉问题依然存在:作为一款62亿参数的小规模模型,ChatGLM2-6B 在知识密集型任务中仍会出现"一本正经地胡说八道"的现象。
2. 许可证限制:ChatGLM2-6B 采用自定义许可证(非标准开源协议),虽然允许学术研究免费使用,商业使用需填写问卷申请,直接嵌入商业产品存在合规风险。
3. 更新换代快:GLM-4 系列已经发布(9B、32B等),ChatGLM2-6B 作为上一代产品可能会逐步失去官方维护。
ChatGLM2-6B 的发布,标志着中文开源大模型进入了一个新的阶段。
从"玩具"到"工具"的跨越:ChatGLM2-6B 在性能大幅提升的同时,INT4 量化后的部署门槛降到了"消费级游戏显卡"级别,让中小企业和个人开发者也能用得起大模型。
开源生态的繁荣:围绕 ChatGLM2-6B 衍生了大量社区项目——从 Web UI(Chuanhu Chat)到加速推理(fastllm、chatglm.cpp),从微调工具(P-Tuning v2)到垂直领域应用,形成了健康可持续的生态。
国产大模型的"练兵场":ChatGLM2-6B 作为开源项目,为国内 AI 研究者提供了一个可自由探索、魔改、对比的基准,极大降低了研究门槛,加速了整个中文 NLP 领域的发展。
它用实际行动证明:不需要千亿参数、不需要百亿投入,一款用心优化的62亿参数模型,同样可以在开源社区大放异彩。