UniCoT
首个统一多模态思维链推理框架,让AI生成图像时具备可解释的边想边做能力,ICLR 2026录用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个统一多模态思维链推理框架,让AI生成图像时具备可解释的边想边做能力,ICLR 2026录用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,AI 在生成一张图片时,是怎么"想"的?它会不会像人类一样,先分析需求,然后一步步规划,最后才动手创作?Uni-CoT(Unified Chain-of-Thought) 就是来解决这个问题的——它让多模态大模型具备了像人类一样"边想边做"的思维链推理能力,而且同时支持文本理解和图像生成,是 ICLR 2026 录用的前沿研究。
传统的思维链(Chain-of-Thought,CoT)推理在纯文本任务上已经取得了巨大成功,它通过让模型"一步一步思考"来提升复杂问题的解答质量。然而,当把 CoT 扩展到多模态场景时,问题变得复杂得多。
在视觉场景中,人类的推理往往依赖于理解视觉状态如何随时间演变——比如追踪物体移动、理解空间交互。这意味着多模态大模型(MLLM)不仅要在文本层面进行推理,还要有效整合并解读视觉线索。简单地把文本 CoT 搬过来是行不通的,因为图像生成和理解有着完全不同的动态特性。
上海 AI 研究院的研究团队敏锐地捕捉到了这个gap,于是在 2025 年推出了 Uni-CoT 框架,其核心思想是将复杂多模态任务分解为结构化的、可管理的步骤,支持顺序或并行执行,从而实现更可扩展、更系统的多模态推理。
Uni-CoT 采用了业界少见的两层分级推理架构,分为 Macro-Level(宏层)CoT 和 Micro-Level(微层)CoT,各司其职,协同工作。
宏层 CoT 负责高层次的规划与任务分解,设计了三种机制应对不同场景:
微层 CoT 则专注于执行单个子任务,通过 Self-Reflection(自我反思)机制 来过滤无关信息,确保每个子任务的输出稳定且高质量。简单来说,宏层负责"做什么",微层负责"怎么做",两者配合形成了一套完整的多模态推理流水线。

图1:Uni-CoT 两层推理架构——宏层负责任务分解规划,微层负责子任务执行与反思
从图中可以看到,宏层会先将用户的复杂需求拆解成多个子任务,然后微层逐一执行,并通过自我反思验证输出质量,最终将所有结果整合成最终答案。
Uni-CoT 框架目前已验证可以解决以下复杂多模态任务:
🎨 可靠的图像生成与编辑:传统文生图模型往往直接输出结果,缺乏解释性。Uni-CoT 让模型在生成前先"思考"——理解用户的意图,分解为多个步骤,逐步生成,这让图像编辑(如修改颜色、替换物体)变得可控且可解释。研究团队在 WISE 图像生成基准 上取得了领先成绩。
🔍 视觉与物理推理:模型不仅能"看"图,还能理解物体之间的空间关系、物理因果等。例如,给定一组物体的排列,模型可以推断它们之间的逻辑关系。
🧩 纳米香蕉式地理推理:这是项目最有趣的 Demo 之一——模型可以用"纳米香蕉风格"来理解地理区域之间的关系,并生成相应的地理推理图,展示了模型对空间概念的深层理解。
📖 多模态故事理解:结合文本与图像理解,模型可以追踪故事发展的视觉线索。

图2:纳米香蕉式地理推理示例——模型对空间概念的深层理解
Uni-CoT 的技术栈选型非常讲究。项目基于 Bagel-7B-MoT 模型构建(由字节跳动 Seed 团队开源),这是一个将文本理解和图像生成能力融合到单一模型中的多模态 Transformer 架构。Bagel 本身已经具备强大的图文能力,Uni-CoT 在此基础上添加了思维链推理层。
从代码仓库的 modeling/ 目录可以清晰看到架构层次:
modeling/qwen2/:基于 Qwen2 大语言模型的 LLM 核心modeling/siglip/:SigLIP 视觉编码器,负责理解图像内容modeling/bagel/:Bagel 模型的核心实现,包括 Navit 视觉 Transformermodeling/autoencoder.py:VAE 变分自编码器,用于图像生成训练方面,项目提供了完整的 SFT(监督微调)框架:
train/pretrain_unified_navit.py:完整参数微调train/pretrain_unified_navit_lora.py:LoRA 高效微调推理方面,核心推理逻辑在 inference_mdp_self_reflection_*.py 中实现。模型使用 System Prompt 来引导模型进行 CoT 推理:
"将你的响应格式化为三个部分:(1) <think>...</think>:在生成前分析提示;(2) <sr>...</sr>:自我反思,评估输出的正确性;(3) 若发现问题,写修改建议并重新生成。
推理代码还支持 CFG(Classifier-Free Guidance)采样、时间步移位等高级生成策略,确保图像质量和推理质量。
技术依赖方面,核心库包括:transformers==4.49.0、torch==2.5.1、accelerate(分布式训练)、bitsandbytes(量化)、gradio(Demo 界面)、wandb(训练可视化)。还预留了 flash_attn(Flash Attention)安装,但默认注释掉了以确保兼容性。

图3:Uni-CoT 图像编辑推理过程——模型先规划步骤,再逐步执行编辑

图4:Uni-CoT 图像生成可视化——带思维链的文生图推理过程
硬件门槛:这是目前开源社区中门槛较高的项目之一。项目文档明确要求 至少 1 块 40GB+ VRAM 的 GPU(推荐 8×A100 80GB)。这是因为 Uni-CoT-7B-MoT 是一个 70 亿参数级别的多模态 Transformer,加上 VAE、视觉编码器等组件,单次推理显存占用相当可观。如果显存不足,生成质量会严重下降。
安装步骤:
conda create -n unicot python=3.10 -y && conda activate unicotpip install -r requirements.txtpip install flash_attn==2.5.8 --no-build-isolation(可选,加速注意力计算)推理方式:项目提供了 test_prompts.txt 作为示例提示文件,用户将自己的提示写入 .txt 文件(每行一个),运行 ./scripts/run_user_self_reflection.sh 即可触发带自我反思的图像生成。批量推理时使用 CUDA_VISIBLE_DEVICES=$i python inference_mdp_self_reflection.py 多卡并行。
评测基准:项目在 WISE 文生图基准、KRIS Bench 和 RISE Bench 图像编辑基准上进行了评测,结果显示 Uni-CoT 在需要复杂推理的生成/编辑任务上优于基线模型。
必须承认,Uni-CoT 目前仍面临一些挑战:
显存瓶颈:40GB+ VRAM 的硬性需求将绝大多数个人开发者和研究者挡在门外。虽然 LoRA 微调降低了训练门槛,但推理仍然需要大显存。
推理速度:两层推理架构虽然提升了质量,但也显著增加了推理延迟。自我反思机制意味着每个子任务都需要多次 LLM forward pass,生成一张图片可能需要数分钟。
覆盖范围有限:当前版本主要验证了图像生成/编辑和视觉推理,尚未支持视频理解/生成(虽然团队已在开发 Uni-ViGU 作为后续项目)。
纳米香蕉推理还在路上:README 中特别注明,纳米香蕉风格的地理推理能力尚处于工作进行中,并非基于最新的 v0.2 checkpoint,结果仅供参考。
Uni-CoT 被 ICLR 2026 录用本身就说明了一个重要信号:多模态思维链推理已经成为 AI 研究的前沿热点。这不仅是学术突破,也为产业应用指明了方向——未来的 AI 助手不仅仅是"给啥输出啥",而是要能够解释自己的推理过程,让用户理解 AI 是如何一步步得出结论的。
从增长曲线看,项目从 2025 年 7 月发布以来,GitHub 星标稳定增长,在 HuggingFace 上的两个 checkpoint(v0.1 和 v0.2)合计下载量可观。研究团队还在持续推进 Roadmap:并行分解、渐进优化、RL 训练框架等能力已在规划中。
一个值得关注的信号是:团队随后又推出了 Uni-ViGU,将统一推理扩展到了视频理解与生成领域。这意味着 Uni-CoT 可能是一个更大愿景的起点——让 AI 在文字、图像、视频所有模态上都能"边想边做"。
一句话总结:Uni-CoT 是目前开源社区中最具野心的多模态思维链推理框架,它让 AI 生成图像时不仅知道"做什么",更理解"为什么这样做",虽然门槛较高,但 ICLR 2026 的录用已经证明了它的学术价值和影响力。如果你对多模态 AI 的可解释推理感兴趣,这个项目值得深入研究。