manga-image-translator
一键翻译漫画、图片中的日文等文字,自动去除原文字并填入译文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一键翻译漫画、图片中的日文等文字,自动去除原文字并填入译文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
zyddnys/manga-image-translator — 9960+ Stars | Python | GPL-3.0

图1:翻译效果示意
你是否有过这样的经历:在二次元群里看到一张日语漫画截图,周围人聊得热火朝天,自己却只能看着满屏"天书"干瞪眼?或者追了一部冷门漫画生肉,翻译组的更新日遥遥无期,只能靠机翻勉强猜剧情?
对于日语初学者、日本文化爱好者乃至专业汉化组而言,图片内文字翻译一直是道难以跨越的坎。传统做法是手动截图→粘贴到翻译软件→对照原图修改,效率极低,且容易出现文字错位。
manga-image-translator 正是为解决这一痛点而生:它能一键识别并翻译图片中的日文(及中文、英文等)文字,输出保留原始排版的干净译文,让你从繁琐的手动翻译中彻底解放出来。
该项目由 GitHub 用户 zyddnys 开发维护,最初的出发点非常朴素:作者本人是日语初学者,在各种群聊和图片网站看到大量日文漫画内容,却无法理解其中意思,于是产生了"不如自己动手做一个"的念头。
随着项目逐渐完善,它吸引了全球范围内漫画爱好者、汉化组、机器翻译研究者的大量关注。仓库长期活跃,2025 年 5 月仍有重大更新,并拥有独立的 Discord 社区(700+ 成员)。项目还支持 Kaggle 在线运行和 Google Colab 云端试用,降低了普通用户的上手门槛。
项目采用模块化的五阶段翻译流水线,每一环节均可独立替换,体现了良好的架构设计思想:
第一步:文字检测(Detection)
采用 CRAFT + DBNet + CTD(Convolutional Characters Transformer Detector)等多种检测模型,精确定位图片中的文字区域。即使是变形、弯曲、密集排列的漫画气泡文字也能准确框选。
第二步:文字识别(OCR)
集成 manga-ocr 专门针对漫画文字优化,结合传统 CV 方法(OpenCV 图像处理、轮廓分析)应对各种复杂背景。能够识别坚体文字、变体假名等日语特有字符。
第三步:机器翻译(Translation)
支持十余种翻译引擎接入:DeepL(高质量商用翻译)、Google Translate(即插即用)、ChatGPT/GPT-4(上下文理解能力强)、Gemini / DeepSeek(新兴大模型翻译)、百度翻译 / 彩云小译(中文生态友好)、Sakura(本地部署无 API 费用)。
用户可自由选择翻译后端,甚至可以组合使用两阶段翻译(先用大模型理解语义,再用 DeepL 优化译文质量)。
翻译完成后,最关键的一步是去除原文字并填入新文字,同时保持画面干净自然,不破坏原始漫画风格。
Inpainting(图像修复) 模块提供了多种算法:LAMA MPE(速度快,效果稳定)、Guided LDM(基于 Stable Diffusion,质量高)、AOT(Aggregated Object Transformation,专门针对漫画风格优化)。
Upscaling(超分辨率) 模块支持 Waifu2x 和 ESRGAN,在文字替换后对图片进行高清放大,适用于保存高清版本。
Rendering(渲染) 模块处理文字排版,支持多语言(Bidi 阿拉伯文、阿拉伯文重塑等),确保译文在气泡内正确排列。

图2:GPU 加速 Web 部署架构(docker-compose)
项目提供了完整的前后端分离 Web 界面:
Web UI 的出现极大降低了使用门槛——用户无需懂命令行,上传图片即可获得翻译结果。
对于高级用户,项目也提供了完整的命令行接口,支持配置文件(JSON/TOML)、翻译链组合、自定义模型路径等高级特性。汉化组可以直接将工具集成到流水线中,实现批量自动化翻译。
需要正视的问题:
manga-image-translator 代表了 AI 图像理解与机器翻译在垂直领域的一个成功落地。2023-2025 年间,随着大型多模态模型的成熟,图片内文字翻译(Image-to-Text Translation)成为 AIGC 的热门方向之一。该项目将复杂的深度学习模型工程化、产品化,让普通用户也能享受技术红利。
从 GitHub 数据看,项目 Star 数已突破 9900,Fork 数超过 1100,持续活跃的 Issue 区和 Pull Request 体现了良好的开源生态。

图3:完整翻译流程示例