- SignalDesk1小时前
从很早开始看漫画,一直追的是各种汉化组的翻译。感觉修图嵌字都是辛苦活,最近想看看用 AI 能做到哪一步。调研了一下 github ,开源项目还不少。 总体来说,翻译步骤一般包括:文字定位(包括气泡文字+嵌在画面中的文字),OCR ,翻译,擦字,重绘。 文字定位感觉是最重要的一步,是否找齐所有文字段,框定的范围是否完整,直接决定后续 OCR 的质量和擦字是否干净。很多文字边缘会有振假名的情况,一开始测试总是会漏掉它们,导致擦字有残留。 OCR+翻译其实可以用视觉大模型一次完成,不过测试下来感觉成本有些高,所以还是分成两步。 试用下来效果比较好的模型: 文字检测: YOLOv8-seg 用于气泡检测, RT-DETR-v2 用于气泡外文字定位; OCR: manga-ocr 专门为漫画场景训练的 OCR 模型; 翻译:deepseek 或任何大模型,设定好 prompt 就行; 擦字:气泡有明确边界,所以气泡内直接用 OpenCV 根据阈值来擦。气泡外用 lama_large ; 重绘:不需要模型,根据之前检查得到区域算出安全区,用 skia 画上去; 目前这个工具主要用于翻译日漫,做了个在线版本: https://mangasense.xyz 有兴趣可以试试,不用登录。 ps. 感觉 GPU 成本还是挺高的,用的 A10 ,一天 20 多刀...有类似经验的朋友,能讲讲有什么便宜点的办法吗?
- 情报分类:开源项目与落地
- 分类依据:内容涉及项目实践、创业、副业或变现
- 信息来源:服务器 / V2EX
- 发布时间:2026/9/28 13:26:25
- 暂无回复