ERNIE-Image
百度开源8B参数DiT文生图模型,超越SDXL/DALL-E 3,精确文字渲染能力领先开源竞品
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
百度开源8B参数DiT文生图模型,超越SDXL/DALL-E 3,精确文字渲染能力领先开源竞品
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否有过这样的经历:脑海里浮现一个画面,却因为不会画画,只能用干巴巴的文字描述,结果 AI 生成出来的图和你想象的大相径庭?文生图模型的「理解力」问题,一直是困扰创作者的核心痛点。而 ERNIE-Image 的出现,正是为了解决这个难题而生。
ERNIE-Image 是百度 ERNIE 团队开源的文生图(Text-to-Image)生成模型,于 2024 年底正式发布。其核心技术架构基于单流式 Diffusion Transformer(DiT),仅用 8B(80亿)参数规模,就在 GenEval 等主流评测基准上取得了开源模型中的 SOTA 成绩,超越了此前被认为难以逾越的 DALL-E 3、SDXL 等竞品,被 HuggingFace 官方评为「令人印象深刻的新开源选手」。
ERNIE-Image 的技术栈分为两大核心模块:
1. Prompt Enhancer(提示词增强器)
这或许是 ERNIE-Image 最有辨识度的设计。大多数文生图模型要求用户具备较高的 prompt engineering 能力——要写得足够详细、精准,模型才能理解你的意图。而 ERNIE-Image 创新性地引入了独立的 Prompt Enhancer(PE)模块,可以将用户简短的输入自动扩展为结构化的丰富描述。
举个例子,用户只需输入「一只黑白相间的中华田园犬」,PE 模块会自动展开为包含品种特征、背景环境、光照氛围、构图风格等维度的结构化描述。这一步对最终生成质量至关重要:README 中的 Benchmark 数据清晰显示,开启 PE 后,GenEval 综合得分从 0.8856 提升到 0.8967,尤其在「计数」(0.7781 → 0.8187)和「属性绑定」(0.7925 → 0.8138)维度提升明显。
2. 单流式 Diffusion Transformer(DiT)
主流文生图模型(如 Stable Diffusion 系列)通常采用多阶段流水线:先文本编码,再图像生成,每一步由不同模型负责。这种架构在训练和推理时存在信息瓶颈,文本与图像表征之间的对齐精度受限。ERINE-Image 选择了单流式 DiT 架构,文本和图像 token 在同一个 Transformer 中联合建模,去掉了隐式对齐的中间层,从根本上提升了指令遵循能力。
DiT 架构本身源自 Sora 等视频生成模型的探索,通过将扩散过程直接建模在隐空间 Transformer 中,大幅提升了生成效率和质量。ERNIE-Image 在此基础上,针对中文语境做了大量优化——这也是百度系模型的传统优势。
在官方披露的 GenEval 评测中,ERNIE-Image 的表现堪称惊艳:
| 维度 | ERNIE-Image (无PE) | ERNIE-Image (有PE) | SDXL | DALL-E 3 |
|---|---|---|---|---|
| 综合得分 | 0.8856 | 0.8967 | 0.80 | 0.67 |
| 单物体生成 | 1.0000 | 0.9906 | ~0.95 | ~0.88 |
| 计数能力 | 0.7781 | 0.8187 | ~0.70 | ~0.65 |
| 文本渲染 | 显著优于竞品 | — | 弱 | 弱 |
特别值得注意的是**文本渲染(Text Rendering)**能力。传统文生图模型的公认难题之一,就是精确渲染文字——海报、商品标签、UI 设计图中出现文字需求时,SD 等开源模型往往会生成乱码或完全错误的内容。ERNIE-Image 在这一维度实现了质的飞跃,特别适合需要精确文字内容的海报、图标、信息图设计场景。
项目同时发布了两个模型版本,供不同场景选择:
| 版本 | 适用场景 | 推荐推理步数 | 速度 |
|---|---|---|---|
| ERNIE-Image | 通用高质量生成 | 50步 | 较慢 |
| ERNIE-Image-Turbo | 快速迭代、实时交互 | 8步 | 快 |
Turbo 版本通过 DMD(Diffusion Model Distillation) 和 RL(强化学习) 双重加速,将推理步数从 50 步压缩到 8 步,同时借助 RL 进一步提升美学评分。对于需要快速看效果的产品原型或实时交互场景,Turbo 版本是更务实的选择。
对于开发者而言,ERNIE-Image 的上手体验相当友好。项目提供了清晰的推理示例代码,只需几行 Python 即可完成从模型加载到图片生成的完整流程:
from diffusers import ErnieImagePipeline
pipe = ErnieImagePipeline.from_pretrained(
"baidu/ERNIE-Image-Turbo",
torch_dtype=torch.bfloat16,
)
pipe = pipe.to("cuda")
output = pipe(prompt="一只黑白相间的中华田园犬",
height=1024, width=1024,
num_inference_steps=8, guidance_scale=1.0,
use_pe=True)
output.images[0].save("./output.png")
依赖环境方面,需要 Python 3.10+、CUDA 11.8+/12.x、transformers >= 4.36、diffusers >= 0.25,以及至少一块显存 24GB+ 的 NVIDIA GPU(A100/A6000/4090/3090 均可)。模型权重通过 HuggingFace 托管,需提前安装 Git LFS 拉取约 16GB 的权重文件。
HuggingFace Spaces 提供免费在线 Demo,无需配置环境即可体验完整功能,是尝鲜的首选入口。
客观地说,ERNIE-Image 也有其局限性:
ERNIE-Image 的发布对开源文生图生态意义深远。
从技术路线看,它证明了中文原生+DiT架构组合的可行性,为国内 AI 研究团队在多模态生成领域树立了一个可对标国际顶级模型的基准。从生态角度看,百度选择将如此规模的核心模型开源,既是技术自信的体现,也是在 AIGC 浪潮中抢占开发者心智的战略布局——类比当年百度开源 Apollo 自动驾驶平台,其背后的逻辑一脉相承。
对 AI 爱好者而言,ERNIE-Image 提供了一个低门槛了解 SOTA 文生图技术的机会,HuggingFace Spaces 让任何人都能免费体验;对开发者而言,DiT 架构的代码相对透明,为微调、蒸馏、二次开发提供了良好的起点;而对于需要精确文字渲染能力的海报设计、电商主图、信息图制作等专业场景,ERNIE-Image 正在成为一个不可忽视的生产力选项。