一份扫描 PDF 看起来是文档,底层却可能只有图片。要让它能搜索、复制或进一步整理,需要 OCR 和文本层。但“识别出文字”与“交付一个好用的文件”之间,还有不少工程细节。
先定义使用场景
用户只是要搜索关键词,还是要复制段落?文本层是否需要和原图严密对齐?文件会在什么系统里打开?这些问题决定了工具的边界,也决定测试不能只看一张样图。
识别之后还有版面
OCR 结果包含文字和位置。写入 PDF 时,要处理坐标、旋转、页面尺寸、字符间距和字体替换。只看识别准确率,可能忽略了搜索命中位置偏移、复制顺序混乱或部分字符无法显示。
在交付环境里测试
批量处理会暴露内存占用、速度、异常文件和平台兼容问题。我的检查顺序通常是:先用少量不同类型文件确认结果,再看长文档和批量任务的稳定性,最后验证目标电脑上的打开、检索和复制体验。
AI 能加快实现,测试仍要回到文件
AI 可以辅助我理解库的接口、生成代码和排查错误;是否真的可用,仍要拿真实文件按目标场景验证。遇到问题时保留可复现的样本,比只记录一条报错更有用。
这篇文章记录的是工作方法,不包含未经核实的性能指标或商业化结论。