JANUS
DeepSeek开源的统一多模态模型,一个Transformer同时搞定图像理解和文生图
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
DeepSeek开源的统一多模态模型,一个Transformer同时搞定图像理解和文生图
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个画家,他既能精确描述一幅画的构图和色彩,也能当场挥笔创作——Janus 就是这样一位 AI 画家与评论家的结合体。由中国 AI 团队 DeepSeek-AI 推出的 Janus-Series,提出了一个优雅的问题:为什么理解图片和生成图片必须用两套不同的 AI 系统?

图1:Janus 统一多模态模型的核心架构,将理解与生成解耦后共用同一个 Transformer
在 Janus 出现之前,业界主流的多模态模型往往面临一个尴尬的结构性矛盾:视觉编码器(Visual Encoder)在「看懂图片」和「画图片」这两种任务上,需要扮演完全不同的角色。
理解任务要求编码器提取图片的语义信息——这是什么物体、什么场景、人物在做什么。生成任务则要求编码器保留细粒度的视觉信息——像素布局、纹理细节、光影层次。这两种需求方向相反,硬塞进同一个编码器里,就像让一个人同时用左手写毛笔字、右手画工笔画,结果往往是两边都差点意思。
Janus 的核心创新正是从这个矛盾出发:解耦视觉编码。DeepSeek-AI 的团队设计了两条独立的视觉编码路径,分别负责理解和生成,再将它们接入同一个大型语言模型(LLM)进行统一处理。就像给一台电脑配了两个显卡——一个专门处理图像识别,一个专门处理图像渲染,各司其职,效率反而更高。
Janus 的架构可以拆解为三个关键组件:
1. 理解编码器(Understanding Encoder) 采用成熟的 SigLIP 或 EVA 视觉编码器,这是专门为图片理解任务训练的模型,能够从图片中提取丰富的语义特征——比如「这是一张客厅照片,有沙发、茶几和落地窗」。
2. 生成编码器(Generation Encoder) 采用来自 VQ-VAE 系列的离散变分自编码器,将图片压缩成离散的 token 序列。打个比方:这就像把一幅画拆成 4096 块拼图,每块拼图用一个编号代表,LLM 只需要「记住」编号序列就能重建原图。
3. 统一 Transformer(Unified LLM) 这才是 Janus 的真正魄力所在。DeepSeek 团队使用了一个 70 亿参数的自回归语言模型(Janus-Pro-7B 版本)作为大脑,无论用户是发一张图片让 AI 描述,还是输入一段文字让 AI 生成图片,底层都是同一个 LLM 在处理——只是输入的 token 类型不同罢了。
这种设计的精妙之处在于:理解和生成任务可以共享 LLM 的全部知识。LLM 在海量文本中学习到的世界知识,可以同时服务于图片理解和图片生成,不会出现「会看不会画」或「会画不会看」的能力割裂。

图2:Janus-Pro 在文字生成图片任务上的效果展示,注意指令跟随能力的提升
2025 年 1 月,DeepSeek 发布了 Janus-Pro,这是 Janus 的全面升级版本。主要改进体现在三个方面:
训练策略优化:团队重新设计了训练流程的课程安排(Curriculum Learning),让模型先学习简单任务再逐步挑战高难度,避免了早期版本训练不稳定的问题。
数据规模扩展:训练数据量相比原版大幅增加,覆盖了更多样化的场景、更高质量的图片-文本对,以及更复杂的指令类型。
模型规模升级:新增了 Janus-Pro-7B(70 亿参数)版本,相比原来的 1.3B 模型,容量提升了 5 倍以上,能够捕捉更精细的图像细节,也具备更强的指令跟随能力。
从测试结果来看,Janus-Pro-7B 在多模态理解任务上可以媲美专门的多模态理解模型(如 CogVLM),在文字生成图片任务上也超越了同尺寸的 SDXL 等专业生成模型,真正实现了「一个模型,两种能力」的承诺。
除了 Janus 和 Janus-Pro,DeepSeek 还推出了一个变体:JanusFlow。这个版本引入了另一种生成范式——修正流(Rectified Flow)。
传统扩散模型生成图片,是从一张纯噪声图片开始,逐步「去噪」成目标图片。JanusFlow 换了一条路:它将图片生成建模为从噪声到图片的最短路径直接传输,数学上更简洁,训练更稳定。
DeepSeek 团队的关键发现是:修正流可以直接在大语言模型框架内训练,无需引入复杂的辅助网络。这使得 JanusFlow 成为目前最简洁的统一多模态模型之一。

图3:JanusFlow 通过修正流实现统一生成,架构更加简洁
对于普通用户而言,Janus 提供了在线 Demo(HuggingFace Spaces),可以直接在浏览器里体验图片理解和文字生成图片,完全不需要任何安装配置。
对于开发者而言,项目提供了完整的推理代码和 Gradio Web UI,可以通过 pip install -e . 一键安装。需要注意的是:7B 版本的模型需要至少 14GB 显存(bf16 精度下),建议使用 RTX 3090/4090 或 A100 等高端显卡。1B 版本对硬件要求较低,适合在消费级显卡上运行。
项目代码结构清晰,核心逻辑在 janus/models/ 目录下,推理脚本 inference.py 提供了单图理解的参考实现,generation_inference.py 提供了图片生成的参考实现。FastAPI 示例(demo/fastapi_app.py)方便开发者将其封装为 API 服务。
Janus 的意义或许不只是推出一个性能不错的模型,而是提出了一个值得整个 AI 社区思考的方向:多模态统一是否应该从架构层面解决,而不是靠简单拼接两个独立系统?
解耦视觉编码的思路看似增加了复杂度,实际上让整个系统更灵活——未来如果要接入视频理解、3D 生成,只需要增加对应的编码器,无需改动 LLM 主干。这为多模态模型的模块化扩展提供了一种可行路径。
目前 Janus 在复杂指令跟随和长文本生成图片的细节控制上仍有提升空间,这些也是未来版本迭代的重要方向。

图4:DeepSeek-AI 团队标志,Janus 系列模型均以双面神 Janus 命名——一面向理解,一面面向生成
项目速览:Janus-Series 由 DeepSeek-AI 开发,采用 MIT 代码协议 + 模型协议双许可证,提供 1.3B/7B 多种规格。核心技术是解耦视觉编码 + 统一 LLM Transformer,实现「一个模型,同时搞定图片理解 + 图片生成」。适合有多模态 AI 研究需求的开发者,关注 AI 前沿技术的爱好者也可以通过 HuggingFace 在线 Demo 直接体验。