MERGE
NeurIPS 2025 录用:一个扩散模型同时搞定图像生成和零样本深度估计
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
NeurIPS 2025 录用:一个扩散模型同时搞定图像生成和零样本深度估计
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你给 AI 一张客厅照片,它不仅能生成一张一模一样风格的新图,还能同时告诉你这个客厅里每个物体离相机有多远——家具的远近、地板的深度、窗户的位置,全部用一张深度图量化呈现。这不是两个模型,而是一个模型同时完成两件事。这就是 MERGE 正在做的事。

图1:MERGE 项目概览 —— 一个统一的扩散模型,同时支持图像生成和深度估计两项任务
2025年10月,华中科技大学(HUST)的研究团队公开了这个名为 MERGE 的开源项目,一经发布即被顶级AI会议 NeurIPS 2025 接收。研究团队来自 HUST 计算机学院,由林鸿凯、梁鼎康、杜明阳、周鑫、白翔(通讯作者)共同完成,其中白翔教授是计算机视觉领域的知名学者。
在此之前,深度估计领域的主流方法是训练专门的深度估计网络。但这类方法有个根本问题:需要大规模标注数据。真实世界的深度标注极其昂贵,不可能覆盖所有场景。
生成式深度估计提供了一个新思路:预训练的文生图扩散模型(如 Stable Diffusion、PixArt)存储了海量的视觉先验知识,包含关于真实世界几何结构的丰富信息。通过巧妙引导,扩散模型可以"提取"出这些几何信息用于深度估计。
但现有方法存在一个致命缺陷:在训练深度估计分支时,模型参数被迫更新,导致生成能力严重下降。训练一个深度估计模型,就等于破坏了一个好用的图像生成模型。
MERGE 提出了一个优雅的解决方案——即插即用(Play-and-Plug)框架,包含两个核心组件。
团队没有直接微调预训练的文生图模型,而是设计了两类轻量级转换器:
Depth Converter(深度转换器):负责将预训练模型的生成特征转换为深度估计特征。它在预训练 transformer 的各层中插入轻量级适配层,训练时只更新这些适配层,保持原始生成模型的完全冻结。
Normal Converter(法向转换器):类似地,转换器也支持表面法向估计(Surface Normal Estimation),输出物体表面各点的法线方向。
两类转换器完全解耦,可以独立训练、独立加载,切换模式时只需切换对应的转换器即可。

图2:MERGE 整体架构 —— 在冻结的预训练文生图扩散模型基础上,通过轻量级转换器扩展深度估计能力
为了进一步提升参数效率,团队引入了组重用机制。传统方法为每个转换器层分配独立的参数,而 MERGE 将转换器分为多个组(groups),不同层可以在组级别共享参数。这不仅减少了可训练参数量,还促进了跨层知识迁移。

图3:MERGE Pipeline —— 通过 pluggable converters 在生成模式和深度估计模式间无缝切换
MERGE 的工作流程巧妙地利用了扩散模型的特性。推理阶段,用户输入一张 RGB 图像,模型做两件事:
图像重建(Generation Mode):模型尝试重建输入图像。由于预训练生成模型"见过"大量真实场景,它会从自身隐空间中寻找与输入图像最匹配的几何结构表示。
深度图提取(Depth Mode):在扩散去噪过程中,Depth Converter 捕获预训练模型各层的隐状态变化,提取出几何特征并解码为深度值。团队发现,生成模型的去噪过程隐式地包含了场景的三维几何信息。
通过一个巧妙的 mode switch 机制,MERGE 在单次推理中同时输出 RGB 图像和对应的深度图(或法向图)。

图4:MERGE 零样本深度估计 Benchmark 结果 —— 在 KITTI、NYUv2 等数据集上达到领先水平
MERGE 在多个标准深度估计基准上取得了 SOTA(State-of-the-Art) 结果:
| 数据集 | 指标 | MERGE 表现 |
|---|---|---|
| KITTI | Abs Rel | 0.052(最优) |
| NYUv2 | delta1 | 94.2% |
| ScanNet | 精度 | 领先同类方法 |
不仅如此,MERGE 还保持了强大的图像生成能力——不像那些训练后生成质量崩溃的方案,MERGE 的生成质量与原始预训练模型几乎一致。
MERGE 提供两个规模的模型:
两者都需要 24GB+ VRAM 的 GPU(实测在 H20-80GB 上通过),推荐使用 A100 或 H100 等高端计算卡。环境配置需要 Python 3.9 + CUDA 11.8 + conda,依赖包括 PyTorch 2.3.1、Diffusers 0.32.1、HuggingFace Transformers 等。
推理示例:
conda create -n merge python=3.9.21 -y
conda activate merge
conda install pytorch==2.3.1 torchvision==0.18.1 pytorch-cuda=11.8 -c pytorch -c nvidia
pip install -r requirements.txt
# 下载预训练权重(HuggingFace)
# PixArt-XL-2-512x512 + merge-base-depth-v1
python inference_merge_base_depth.py \
--pretrained_model_path PATH/PixArt-XL-2-512x512 \
--model_weights PATH/merge_base_depth \
--image_path ./data/demo_1.png
依赖中包含 Gradio,说明团队有计划提供 Web 界面,但目前尚未实现独立的一键启动 demo 服务。
值得指出的是,MERGE 目前的 Demo 版本依赖 HuggingFace 的远程服务,本地独立部署的 Web UI 尚未完成。此外,项目目前仅支持英文场景,对中文语义理解尚无特别优化。
从学术价值看,MERGE 的最大贡献在于证明了"冻结预训练模型 + 即插即用转换器"范式的可行性——不微调大模型本身,仅靠小型适配层就能赋予模型新能力,同时保持原有能力不损失。这对整个 AI 社区都有重要的方法论启示。
MERGE 是一项来自 NeurIPS 2025 的扎实工作,它用简洁优雅的方式解决了生成与深度估计鱼和熊掌不可兼得的困境。核心贡献包括:
对于想深入理解扩散模型几何先验的研究者,或者需要高质量深度图的计算机视觉工程师,MERGE 都是值得关注和复现的优秀工作。