Recommendations-Diffusion-Text-Image
扩散模型文字渲染领域最全论文合集,11大任务类型,覆盖 CVPR/AAAI/ICCV 顶会工作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
扩散模型文字渲染领域最全论文合集,11大任务类型,覆盖 CVPR/AAAI/ICCV 顶会工作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:项目首页概念图,展示扩散模型在文字-图像生成领域的覆盖范围
你有没有见过这样的画面:用 Midjourney 或 DALL·E 生成一张电影海报,输入的 Prompt 是"Cyberpunk neon city at night, the sign reads '城市之光'"——结果 AI 确实画出了一座赛博朋克夜景,霓虹闪烁、色彩迷离,但那个本该醒目的大字招牌,歪歪扭扭地变成了一堆无法辨认的"鬼画符"?
这几乎是所有主流文生图模型的通病:理解语义很强,但文字渲染极弱。字要么缺笔少划,要么干脆就是一团无法辨认的色块。这个问题在电商海报、广告设计、品牌 logo、电影字幕等实际场景中,几乎是致命的——因为在这些场景里,文字本身就是信息的核心载体,而不是可有可无的背景装饰。
那么,学术界是如何解决这个问题的?Recommendations of Diffusion for Text-Image(以下简称 RDTI)就是一把打开这个研究领域大门的钥匙。
RDTI 是由开发者 yeungchenwa 创建的扩散模型文图任务论文合集,目前收录了数十篇(按 README 分类统计)高质量学术论文,覆盖扩散模型在以下 11 个文字-图像相关任务中的最新进展:
| 任务类别 | 代表性工作 |
|---|---|
| 文档修复 (Document Restoration) | HDR (AAAI 2025) |
| 字体生成 (Font Generation) | FontDiffuser (AAAI 2024)、DiffCJK |
| 可视化文字生成 (Visual Text Generation) | GlyphDraw、AnyText、TextDiffuser |
| 艺术字体 (Artistic Font) | Word-As-Image (SIGGRAPH 2023)、DS-Fusion (ICCV 2023) |
| 文字图像去除 (Text Removal) | OCR-SAM |
| 文字图像超分辨率 (Text SR) | DiffBIR、TextDiff |
| 文字图像编辑 (Text Editing) | DiffUTE |
| 图像补全 (Inpainting) | GSDM (AAAI 2024) |
| 手写体生成 (Handwritten) | WordStylist (ICDAR 2023)、ChiroDiff (ICLR 2023) |
| 场景文字识别 (Scene Text Recognition) | DiffusionSTR、IPAD (TPAMI 2023) |
| 场景文字检测 (Scene Text Detection) | DiffText |

图2:RDTI 收录的论文按任务类型分类整理,每类包含多篇顶会论文及对应资源链接
大语言模型(LLM)在文本理解和生成方面已经达到了令人惊叹的水平,GPT-4、Claude 3 等模型可以写出媲美人类作家的文章。然而,在视觉领域,文字渲染却一直是公认的难题。这是因为:
文字渲染同时涉及三种能力的融合:
Diffusion 模型(扩散模型)近年来在这三方面的能力上都有了突破性进展。例如 Glyph-ByT5-v2 在多语言视觉文字渲染上的准确率大幅提升,AnyText 可以生成支持多语言的文字图像,DS-Fusion 则实现了艺术字体的风格化生成。
RDTI 的一大特色是论文来源质量高。收录的论文广泛来自 CVPR、AAAI、ICCV、ICLR、ICDAR 等全球顶级学术会议和期刊,并且每篇论文都附带了:
这对于想快速了解某一子领域最新进展的研究者来说,相当于一份现成的研究路线图,节省了大量搜集和整理的时间。
这一领域的技术突破直接催生了大量实用工具:
RDTI 是一个纯文档型仓库,结构极为简洁:
Recommendations-Diffusion-Text-Image/
├── README.md # 核心内容:分类论文列表
└── imgs/ # 图片资源(logo、概念图)
README 按 11 个任务类型组织,每个类别下列出相关论文,格式统一为:
+ [论文标题](arXiv链接) (发表年份/会议)
- [arXiv] 原文
- [Project] 项目主页
- [Star] GitHub 仓库
- [Demo] 在线体验地址
使用门槛极低:任何人都可以直接在 GitHub 网页端阅读,也可以将仓库克隆到本地进行批量化信息提取,或者 fork 后添加自己的笔记和研究心得。
纯论文合集,无可运行代码:RDTI 本身不提供任何模型的训练脚本或推理代码,但它链接的各个 GitHub 仓库通常包含完整实现。
非活跃维护:从仓库更新频率来看,这是一个个人维护的学术资料整理项目,更新取决于作者是否有新的论文产出。对于最新论文可能存在一定滞后。
图片加载依赖网络:README 中引用的外部图片(项目主页截图、Demo 截图等)需要稳定的网络连接才能正常查看。
语言问题:虽然项目 README 本身是英文,但链接的很多项目主页和 Demo 是中文环境(特别是国内厂商如 OPPO-Mente-Lab、阿里等),需要适当适应。
RDTI 折射出一个正在快速升温的研究方向:让 AI 不只能"看懂"文字,更能"写出"精准、美观的文字。
从技术演进路径来看,这个领域正在经历三个阶段的跨越:
从市场角度看,文生图领域的竞争已经从"能不能生成一张好看的图",逐渐转向"能不能精准控制图中的每一个细节"——文字作为信息密度最高的视觉元素,自然成为下一个技术突破的焦点。Adobe Firefly 2、Google Imagen 2、Stability AI 的新版本模型都在加强文字渲染能力,这个趋势已经非常明确。
Recommendations of Diffusion for Text-Image 是一个高价值学术资源聚合项目,它以清晰的分类体系和规范的引用格式,为研究者和从业者提供了一站式了解"扩散模型 + 文字渲染"领域全貌的入口。
虽然它本身不包含可运行代码,但对于以下几类人群极具价值:
如果你对 AI 生成图像中的文字渲染感兴趣,或者正在从事多模态 AI 方向的研究,这个仓库值得加入你的书签列表。