CogView4
国产首个支持图像内生成汉字的开源文生图模型,60亿参数,DPG-Bench综合排名第一,Apache 2.0开源协议
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
国产首个支持图像内生成汉字的开源文生图模型,60亿参数,DPG-Bench综合排名第一,Apache 2.0开源协议
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025 年 3 月,一则新闻在 AI 圈炸开了锅:智谱 AI 发布了 CogView4,这是全球首个支持在图像中生成汉字的开源文生图模型。消息一出,国内众多设计师和创意工作者炸了锅——以往用 Midjourney、Stable Diffusion 生成一张带中文的海报,简直比登天还难,出来的字不是错别字就是乱码。而 CogView4 轻轻一笔,一幅"无敌炒面"海报就出来了,字迹工整得让人怀疑这是不是 AI 画的。
这背后,是一支来自清华、智谱的团队,用整整三年的技术迭代,将中国文字理解能力嵌入了扩散模型的最核心。

CogView 系列是智谱 AI(MOSS 团队)的招牌图像生成模型家族,演进路径清晰:
CogView4 是智谱 AI "2025 开源年" 发布的第一款模型,采用 Apache 2.0 开源协议。仓库同时托管了 CogView3 和 CogView3-Plus 的代码,包含三条技术路线的演进积累。
CogView3-Plus 使用 Google 的 T5-XXL 编码器(纯英文),CogView4 大胆换上了具备双语能力的 GLM-4-9B 大语言模型作为文本编码器。提示词长度上限从 224 Tokens 跃升至 1024 Tokens。
支持 512×512 到 2048×2048 范围内任意分辨率生成(H×W ≤ 2²¹,H 和 W 均为 32 的倍数)。位置编码采用 2D RoPE(二维旋转位置编码)。
2025 年 3 月底,团队进一步开源了 CogKit,支持 CogView4、CogVideoX 系列微调和推理,配合低显存优化技术,在单张 RTX 4090 上即可完成 LoRA/SFT 微调。

访问 HuggingFace Space:CogView4 主站 或 ModelScope 魔搭社区 镜像。
pip install -r inference/requirements.txt
pip install diffusers transformers accelerate
python inference/gradio_web_demo.py
| 配置 | 显存需求 |
|---|---|
| BF16 全精度 | 33-39GB |
| BF16 + CPU offload | 20GB |
| BF16 + CPU offload + Int4 Text Encoder | 13-14GB |
| 基准测试 | 成绩 | 排名 |
|---|---|---|
| DPG-Bench(综合) | 第一 | #1 |
| T2I-CompBench | 0.7786 | #2 |
| GenEval | 0.73 | #2 |
| 中文文字准确率(F1) | 0.6168 | 超越快手可图 |
中文文字准确率是 CogView4 相比竞品的核心优势,F1 得分 0.6168,远超快手 Kolors 的 0.288。

CogView4 选择 Apache 2.0 协议,让"中文文字精准生成"从商业闭源模型专属能力,变成开源社区人人可用的公共资产。国内广告、电商、游戏行业的企业可低成本合规使用文生图技术。
| 项目 | 信息 |
|---|---|
| 开发者 | 智谱 AI(MOSS 团队/THUDM) |
| 参数规模 | 6B(CogView4)/ 3B(CogView3-Plus) |
| 开源协议 | Apache 2.0 |
| 主要语言 | Python |
| 核心框架 | diffusers, PyTorch, Transformers, Accelerate, Gradio |
| 文本编码器 | GLM-4-9B(双语) |
| 模型架构 | Diffusion Transformer(DiT) |
| 最低显存 | 13GB(Int4 量化方案) |
| 模型下载 | HuggingFace / ModelScope / WiseModel |
本报告由 PIFS 分析引擎自动生成 | 数据来源:GitHub、智谱 AI 官方文档、新京报、智东西等媒体报道