资讯动态

漫画AI翻译流水线完整解析:文字检测、OCR识别与图像修复原理详解

发布时间:2026/10/2 7:06:05 来源:尧图企业网站定制
漫画AI翻译流水线完整解析文字检测、OCR识别与图像修复原理详解【免费下载链接】manga-translator-ui基于manga-image-translator 实现的开源漫画AI翻译桌面工具。支持日、韩、英文漫画自动处理集成OpenAl、Gemini等多翻译引擎实现OCR文字检测、原文擦除、AI翻译、图像修复、译文排版完整链路自带可视化编辑器支持自定义文本样式一键部署开箱即用。项目地址: https://gitcode.com/gh_mirrors/man/manga-translator-uiManga Translator UI是一款基于 manga-image-translator 的开源漫画 AI 翻译桌面工具支持日、韩、英文漫画自动处理集成 OpenAI、Gemini 等多翻译引擎实现「文字检测 → OCR → 原文擦除 → AI 翻译 → 图像修复 → 译文排版」完整链路自带可视化编辑器开箱即用 下面带你从源码视角拆解这套核心流水线看看每一张漫画页是如何被翻译的。一张漫画页的一生7 个阶段的处理链路当你把一个漫画文件夹丢进程序核心引擎 MangaTranslator 会按固定顺序执行以下流水线见translate_batch主流程 manga_translator.py检测 Detection → OCR 识别 → 文本行合并 → AI 翻译 → 蒙版优化 → 图像修复 Inpainting → 译文渲染 Rendering阶段职责源码入口① 文字检测找出所有文字行生成检测框与原始蒙版_run_detection② OCR 识别把检测框里的字符读出来_run_ocr③ 文本行合并把零散文字行合并成段落区域_run_textline_merge④ AI 翻译批量调用翻译引擎_batch_translate_contexts⑤ 蒙版优化生成贴合文字的擦除蒙版_run_mask_refinement⑥ 图像修复用 AI 填补擦除后的空白_run_inpainting⑦ 译文渲染把译文按原文风格排版回图片_run_text_rendering 这套配置在界面上全部可视化「参数设置」页按流水线阶段分成了通用 / 文字识别 / 检测 / 翻译 / 修复 / 排版六个标签页改哪一步就看哪个标签。阶段①文字检测——先找到哪里有字漫画文字检测的难点在于文字大小不一、排版倾斜、还经常压在画面纹理上。程序通过dispatch_detection调度不同的检测器CRAFT、DBNet、YOLO-OBb 等入口在 manga_translator/detection/ 目录craft.py经典 CRAFT 文字区域检测dbnet_convnext.py基于 ConvNeXt 的检测器yolo_obb.pyYOLO 旋转框检测擅长倾斜文字检测完成后_run_detection 会做两件关键的清洗工作NMS 去重按置信度排序检测框用 IoU 0.9 的阈值剔除重叠框L2000-L2037避免同一行字被识别两次拆分 other 类框把非正文标签如other分离出来供后续特效字/装饰字智能合并使用L2039-L2048。这一步同时产出两份数据textlines检测框列表和mask_raw原始像素蒙版——前者决定读什么后者决定擦哪里。阶段②OCR 识别——混合识别引擎兜底拿到检测框后_run_ocr 调度 OCR 引擎48px 模型、48px CTC、manga-ocr、PaddleOCR 等位于 manga_translator/ocr/逐框读取文字。真正的设计亮点是混合 OCRHybrid OCR策略L2638-L2684先用主 OCR 引擎识别全部文本行对识别结果为空或置信度低于阈值的行自动切到副 OCR 引擎二次识别把二次识别结果回填最后统一做低置信度过滤。这种双引擎接力让手写体、艺术字、低分辨率扫描页的识别率明显提升而代价只是少量行的重复计算。阶段③④行合并与 AI 翻译零散的文字行直接翻译效果很差一句话被切成三行。_run_textline_merge 调用 manga_translator/textline_merge/ 将相邻且属于同一气泡的文字行合并成text_regions文本区域同时自动判定每个区域的横排/竖排方向与对齐方式。随后 _batch_translate_contexts 把所有区域文本按batch_size分批经 _batch_translate_texts 提交给翻译引擎——OpenAI、Gemini、Sakura 等实现都放在 manga_translator/translators/ 下通过dispatch统一调度。翻译后还有 _validate_translation 做目标语言比例校验与幻觉重复检测不合格自动重试。阶段⑤蒙版优化——擦除前的精准描边擦除原文最怕擦过头或擦不净。_run_mask_refinement 调用 manga_translator/mask_refinement/text_mask_utils.py以fit_text策略基于检测蒙版mask_raw 合并后的 text_regions 生成优化蒙版并支持可控膨胀半径kernel_size、mask_dilation_offset盖住笔画边缘抗锯齿像素与气泡蒙版求交limit_mask_dilation_to_bubble_mask防止蒙版扩散到气泡外的画面上。若模型方案失败会优雅降级为简单形态学膨胀L4713-L4717保证流程不中断。阶段⑥图像修复——AI 补全被擦除的背景有了精准蒙版_run_inpainting 调度修复模型位于 manga_translator/inpainting/修复器文件特点LaMa / LaMa-MPEinpainting_lama.py速度快线条修复干净AOTinpainting_aot.py基于注意力 TransformerSD / Guided-SDinpainting_sd.py扩散模型级画质FLUXinpainting_flux.py新一代扩散修复这里还有两个省资源的小技巧纯色气泡直填solid_fill_pure_bubbles纯白/纯色气泡直接采样背景色填充跳过昂贵的模型推理L3248-L3272分块修复per_block_inpainting按蒙版孤立连通块逐块裁窗修复避免长图整页推理爆显存L3274-L3287。阶段⑦译文渲染——让翻译长回原图最后是 _run_text_rendering调用 manga_translator/rendering/ 的排版引擎把译文按原文区域的字体、字号、角度、横竖排、对齐方式重绘到修复后的画面上支持中文智能断行chinese_linebreak.py、自动换行与富文本样式。渲染完成后所有区域坐标、原文、译文、蒙版会一并写入 JSON 工程文件get_json_path供可视化编辑器二次精修。想深入调试看这些地方每一步的输入输出都可在 verbose 模式下落盘为调试图文件夹命名规则见 folder-naming-and-overview.md检测与 OCR 阶段的深入解读ocr-and-text-regions.md、input-detection-and-rearrangement.md蒙版与修复阶段原理mask-inpainting-and-rendering.md。总结一条流水线六次精准回顾整条链路Manga Translator UI 的核心设计哲学可以概括为**每阶段只做一件事且都尽量精准**检测精准定位、OCR 精准读数、蒙版精准描边、修复精准补全、渲染精准还原。每个阶段都通过统一的dispatch模式解耦替换检测器、OCR 或修复模型只需换一个配置项——这正是它能稳定支撑日、韩、英三语漫画全链路自动翻译的关键 对于新手来说你不需要理解每一行代码打开「参数设置」按上表七个标签逐个微调即可。而对于想贡献代码的开发者manga_translator/manga_translator.py 中_run_detection → _run_ocr → _run_inpainting → _run_text_rendering这条调用链就是最好的源码导游。【免费下载链接】manga-translator-ui基于manga-image-translator 实现的开源漫画AI翻译桌面工具。支持日、韩、英文漫画自动处理集成OpenAl、Gemini等多翻译引擎实现OCR文字检测、原文擦除、AI翻译、图像修复、译文排版完整链路自带可视化编辑器支持自定义文本样式一键部署开箱即用。项目地址: https://gitcode.com/gh_mirrors/man/manga-translator-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑