各位佬们,我手头有一批古老的的汉文报纸扫描件需要做数字化处理,遇到几个比较棘手的问题,想请教大家有没有成熟的方案或工具推荐。 报纸文字特征: 字形不统一:繁体、简体、旧字形 / 俗字混用,介于港台繁体和大陆规范简体之间; 排版方向混排:同一版面上有竖排从右往左(照片说明、大标题),有横排从右往左(老式横排正文),也有横排从左往右(广告、后期内容); 印刷质量一般:扫描件墨色不均、字号偏小,照片、广告、正文混排; 专有名词多:人名、地名、机构名、通讯社电头等需要准确。 我的需求: 准确识别全部文字内容,并转成规范简体中文,尽量保留分栏分段结构。 目前试过的: 通用 OCR(手机截图识字、普通网页 OCR)对竖排和老式横排方向判断经常出错,繁简转换也不准,错字率比较高。 想请教: 这类老报纸有没有专门的 OCR 工具或模型推荐?(本地可部署最好,云 API 也可以) 排版方向混排大家是怎么处理的?分栏切割后单独识别,还是有自动判断方向的方案? 繁简转换用什么工具比较靠谱?旧字形 / 俗字怎么处理? 有没有类似的批量处理脚本或工作流可以参考? 报纸量级大概几百版,如果有可复用的流程就最好了。谢谢大家! 2 个帖子 - 2 位参与者 阅读完整话题


  • 情报分类:硬件与数码
  • 分类依据:内容涉及硬件、数码产品或通信卡
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/9/14 10:29:13