PosterOmni
CVPR2026 录用论文,一个扩散模型统一搞定海报改比例、扩图、补全、换风格、换布局、ID保持六大设计任务,全面超越开源基线
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
CVPR2026 录用论文,一个扩散模型统一搞定海报改比例、扩图、补全、换风格、换布局、ID保持六大设计任务,全面超越开源基线
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
作者团队:美团 + 香港科技大学(广州)|发表:CVPR 2026|GitHub:205★
你有没有过这种经历:拿着一张旧海报想让设计师「换个比例、再加点内容、保持整体风格」,结果设计师要返工三版、磨上一周?在 AI 生成时代,一个常见误解是:AI 海报 = 输入一句文字描述,AI 生成一张新图。但真实设计流程的起点,往往是一张已有的参考图——可能是旧海报、产品主视觉、甚至是随手拍的设计草图。
PosterOmni 解决的正是这个「参考图 + 指令」场景。它不追求「从零生成」,而是在保留原图核心元素和执行设计意图之间找到了精妙的平衡。只需给出一张参考图加一句自然语言指令,它就能完成扩图、补全、改比例、换风格、换布局等一系列操作,输出的结果「像是同一个设计师在原图基础上做的专业调整」。
在此之前,设计师和研究者通常需要多个专用模型配合使用:改比例用一个、扩图用一个、换风格再用另一个。模型之间能力不互通,切换成本高,而且每个模型往往只擅长自己的单一任务。
PosterOmni 的核心贡献,是把六类设计任务统一在单一模型里:
| 任务类型 | 具体操作 | 典型场景 |
|---|---|---|
| 局部精修 | Rescaling(改比例) | 把竖版海报改成横版 |
| Filling(内容补全) | 扩大画布后智能填充新区域 | |
| Extending(扩图) | 四周扩展并保持视觉一致性 | |
| Identity-driven(ID保持) | 换背景或场景时保持主体身份特征 | |
| 全局再设计 | Layout-driven(布局迁移) | 参考A海报的版式生成B内容 |
| Style-driven(风格迁移) | 参考风格图生成全新内容 |
这六类任务覆盖了真实设计场景中约80%的「参考图修改」需求。
PosterOmni 的技术方案分四个阶段,层层递进:
第一阶段:任务专家 SFT
团队首先在20万+训练样本(PosterOmni-200K)上,针对每个任务分别训练专属的「专家模型」。这些专家在各自任务上能力极强,但互不兼容。这一步建立了一个高质量的能力基准线。
第二阶段:任务蒸馏
这是最关键的一步——把六个专家模型的知识蒸馏到一个学生模型里。蒸馏的核心挑战是:局部精修任务(如改比例)要求精准像素级操作,而全局创作任务(如风格迁移)更依赖高层次的语义理解,两类任务的行为模式差异很大。PosterOmni 通过精心设计的蒸馏策略,让单一学生模型同时掌握「精细操作」和「宏观创作」两种能力。
第三阶段:统一奖励训练
引入奖励模型(Reward Model),从三个维度评估生成结果:
一个巧妙的细节是团队引入了 negative-pair 策略:把输入参考图本身当作「被拒绝」的选项,模型编辑后的结果作为「被选择」的选项。这逼迫奖励模型认识到「有意义的改动」本身就是价值,避免模型在某些任务(尤其是布局或风格类)里学会「偷懒」——直接把参考图 copy 过去。
第四阶段:强化学习对齐
最后一步,用强化学习(基于奖励模型的反馈)将学生模型进一步对齐到专业设计水准,使输出结果不仅「符合指令」,而且「足够好看」。
团队建立了 PosterOmni-Bench 评测基准,包含1020条中英文测试提示,均匀覆盖六类任务和六个海报主题(产品、食品、活动、自然、教育、娱乐)。
对比主流开源和闭源系统,PosterOmni 在六项任务上全部拿到最高分,整体评分(美学质量/任务对齐)达到 4.27/4.37(满分5分),超越了部分商业系统:
上手方式一:Gradio 网页界面(推荐尝鲜)
项目提供了开箱即用的 Gradio demo,运行 python demo_gradio.py 即可在浏览器中体验所有六个任务。输入参考图 + 选择任务类型 + 填写提示词,三步出结果,适合快速验证想法。
上手方式二:命令行推理(适合批量处理)
通过 posteromni_inference.py 脚本调用推理接口,需要指定基础模型(Qwen-Image-Edit-Plus)+ PosterOmni 权重(MeiGen-AI/PosterOmni_v1)。以改比例为例:
python posteromni_inference.py \
--task poster_rescaling \
--image_path your_poster.jpg \
--prompt "Rescale image to 16:9." \
--base_model_path "Qwen-Image-Edit-Plus" \
--transformer_path "MeiGen-AI/PosterOmni_v1" \
--output_path result.png \
--steps 40 \
--cfg 4.0 \
--seed -1
硬性门槛——GPU是必须的:PosterOmni 基于扩散模型(Diffusion)架构,推理需要 NVIDIA GPU,推荐显存24GB+,最低16GB。纯CPU环境无法在合理时间内完成推理。如果机器没有GPU,可以考虑调用HuggingFace上的兼容推理API,或等待社区提供优化版本。
依赖安装的坑:README明确要求 pip install git+https://github.com/huggingface/diffusers 从源码安装最新版diffusers(而非pip版本),这一步在网络不稳定时可能耗时较长。
1. 权重只提供Transformer部分:HuggingFace上开源的只是diffusion transformer权重,不包含VAE、文本编码器等完整pipeline组件。用户需要自行加载兼容的基础模型(如Qwen-Image-Edit-Plus),这增加了部署复杂度。
2. ID驱动的多图支持有限:ID-driven任务虽然支持多张参考图输入(space-separated),但对输入图片的内容一致性要求较高,多角色或复杂场景下的身份保持效果还有提升空间。
3. 推理速度受限于扩散模型特性:40步推理在A100上约需30-60秒,在消费级GPU上可能更慢。对于需要快速迭代的设计工作流(特别是需要多次调整prompt的场景),现阶段的推理延迟是一大瓶颈。
4. 官方数据集链接标注为TODO:README中Dataset链接指向TODO,说明完整的训练数据集尚未公开发布,目前只有评测基准 PosterOmni-Bench 可用。
PosterOmni 的出现,让「AI 海报工具」从 demo 走向了可工程化使用的阶段。它的意义不仅在于刷新了SOTA分数,更在于它证明了:一个经过系统设计的扩散模型,可以通过任务蒸馏和强化学习,同时掌握「精准局部操作」和「高层次语义创作」两种看似矛盾的能力。
从商业视角看,PosterOmni 的开源填补了开源社区在专业海报编辑领域的空白。在它之前,设计从业者如果想用AI辅助工作,要么依赖昂贵的闭源商业API(如Seedream),要么使用能力分散的多个开源模型组合。PosterOmni 提供了第一个真正意义上的「全能选手」。
随着社区在此基础上进一步优化推理速度、压缩模型体积,这类工具未来有望真正嵌入设计师的日常工作流——不是替代设计师,而是成为那个「随时待命的执行助理」,把「改比例」、「扩图」、「换风格」这类重复性操作自动化,让设计师把精力集中在更核心的创意决策上。
项目主页:ephemeral182.github.io/PosterOmni | 模型权重:HuggingFace MeiGen-AI/PosterOmni_v1 | 论文:arXiv:2602.12127