今天做了什么
- 两本扫描版教材的中文OCR与Markdown转换跑通了
- 在Windows笔记本上搭了一套本地转换流程
- 两本书加起来675页,六十多万字符
- 建了一套可重复使用的通用流程
关于OCR这件事
今天把两本扫描版教材转成了Markdown。一本360页,一本315页,加起来675页,都是扫描版PDF,没有文本层,只能靠OCR硬识别。
关于环境搭建
先在Windows笔记本上装了一圈东西:Rust、Cargo、Visual Studio C++ Build Tools,然后装pdfly,再配RapidOCR、PP-OCRv6、ONNX Runtime。
pdfly对有文本层的PDF好用,但它的OCR后端不支持中文。所以换成RapidOCR处理中文扫描书。
关于这套流程
两本书跑完之后,电脑上已经有一套可复用的本地转换能力了。
中文扫描PDF自动OCR、每页断点保存意外中断能续跑、自动识别章节和多级标题、输出全文版和分章版、保留PDF页码便于回查原书、生成TXT和原始OCR坐标。章名和目录结束页可以针对不同教材单独配置。
下次再来一本书,直接复用就行。
关于资源消耗
大规模OCR主要靠笔记本本地CPU和内存跑,模型tokens只花在方案设计、脚本开发、结构修正和质量检查上。正文由本地OCR直接写入文件,没有把几十万字逐页喂给对话模型,这个策略是对的,不然tokens会炸。
后续
流程可以继续封装成批处理工具。几十本PDF扔进一个文件夹,自动逐本转换、断点续跑,输出成功清单和异常报告。特殊排版的再单独处理。
