JoyAI-Image
京东开源的统一多模态图像模型,支持图像理解、指令引导编辑与文生图三大能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
京东开源的统一多模态图像模型,支持图像理解、指令引导编辑与文生图三大能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你有一张客厅的照片,想把茶几从沙发左边挪到右边,同时保持投影的阴影、窗外光线的角度、以及电视柜与茶几的相对位置完全不变。传统AI修图工具会让你反复描述"保持XX不变",结果往往不尽如人意——影子歪了,或者茶几比例失调。
京东开源的 JoyAI-Image 解决的就是这个问题。它不仅能修图,还能"理解"物体之间的空间关系,让编辑结果在几何上保持一致。这背后是一套统一的多模态基础模型架构,同时支持图像理解、文生图、指令引导的图像编辑三大能力。
JoyAI-Image 由京东开源团队发布(jd-opensource),是一个参数量达 8B 的多模态大语言模型(MLLM)与 16B 多模态扩散Transformer(MMDiT)的统一架构。2026年4月首次发布,5月即被 HuggingFace diffusers 官方仓库合并 PR,标志其接口已成为行业标准。
项目背景有几个关键点值得关注:
JoyAI-Image 的核心设计理念是"闭环协作"——更强的空间理解带来更精准的生成和编辑,而生成过程中的视角变换又反过来增强空间推理能力。
架构组成:
三大核心能力:
inference_und.py,输出纯文本。JoyAI-Image 的空间编辑是项目最有技术含量的部分。与传统"涂抹-重绘"式的编辑不同,它通过 MLLM 对场景进行语义解析和空间建模,再由 MMDiT 执行几何一致的变化。
物体移动(Object Move):
编辑指令格式为 Move the <object> into the red box and finally remove the red box. 其中红框标注目标区域。MLLM 解析出被操作物体的掩码及目标位置,MMDiT 执行形变。适合的场景包括:将商品从背景移到特定位置、将家具重新布局等。
物体旋转(Object Rotation):
格式为 Rotate the <object> to show the <view> side view. 支持 front、right、left、rear、front right、front left、rear right、rear left 等8个标准视角。这一能力对 3D 重建和数据增强极有价值——给定单视角图像,可合成其他视角视图。
相机控制(Camera Control): 格式包含 Yaw(水平旋转角度)、Pitch(俯仰角度)、Zoom(in/out/unchanged)三个维度,用于生成新视角图像而不改变场景内容。这对条件帧视频生成(首帧→末帧插帧)和 3D 重建(NeRF/GS)都有重要意义。
JoyAI-Image 提供了三种使用方式,从易到难排序:
① Diffusers(推荐,最简单):
2026年5月,JoyAI-Image 的 JoyImageEditPipeline 已合并入 HuggingFace diffusers 主分支(v0.38+)。安装方式:
pip install torch transformers torchvision
pip install git+https://github.com/huggingface/diffusers.git
调用仅需约20行代码,3行核心逻辑即可完成图像编辑。权重从 HuggingFace 自动下载。
② ComfyUI(适合工作流编排):
官方提供 joyai_image_comfyui/ 节点包,可直接集成到 ComfyUI。包含配置文件和自定义节点,适合需要批量处理或复杂工作流的用户。
③ 本地 CLI(适合开发者):
inference.py 提供完整的命令行推理能力,支持自定义步数、CFG、负向提示词、多卡 FSDP 推理等高级参数。但需要自行准备:
text_encoder/ 等子目录)JoyAI-Image 对硬件有较高要求:
当前不支持:
JoyAI-Image 并非完美,在部署和使用中发现以下局限:
--rewrite-prompt,需要接入 GPT-5 等商业 API,增加成本。JoyAI-Image 的出现代表了2026年多模态模型的一个重要方向:从单一能力(文生图)走向统一架构多能力融合。此前,Stable Diffusion 擅长生成但不懂编辑,GPT-4V 擅长理解但不会生成。JoyAI-Image 通过 MLLM-MMDiT 统一架构,第一次在开源领域将理解和生成做成了真正的闭环。
特别值得关注的是其在"空间智能"方向的努力——OpenSpatial-3M 数据集和 SpatialEdit 评测基准的开源,对整个社区的空间推理研究有基础建设价值。随着权重逐步开源和 diffusers 集成的成熟,预计将吸引更多开发者和研究人员基于此做二次开发。
适用场景推荐: