恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
OCRmyPDF 完整教程:三步把扫描 PDF 变成可搜索文档
首页
资讯中心
/
OCRmyPDF 完整教程:三步把扫描 PDF 变成可搜索文档
OCRmyPDF 完整教程:三步把扫描 PDF 变成可搜索文档
发布时间:2026/8/22 0:16:28
OCRmyPDF 完整教程三步把扫描 PDF 变成可搜索文档【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF如果你搜过一个扫描版 PDF、发现搜索框里什么都找不到那这个问题靠换 PDF 阅读器解决不了。OCRmyPDF 是一类专门的 OCR 工具它在不改动扫描页面的前提下给 PDF 补上一层 OCR 识别出来的隐形文字让文件立刻能搜索、能复制。这篇文章带你从安装到跑通第一个文件顺带把几个常见坑绕开。为什么扫描 PDF 搜不到字扫描版 PDF 本质上是套了 PDF 壳的图片——每一页都只是一张照片里面没有任何文字对象。OCR光学字符识别模拟的就是认字这件事逐页看像素把看到的字符转成文本。OCRmyPDF 的工作方式比较克制它不重绘页面而是调用底层的 tesseract 识别引擎把每页的文字找出来再把这些结果作为一层透明文字写进 PDF 里。表面上你看到的还是那张扫描件但每个字都变成了可选中、可复制、可搜索的对象。上面这种老手册、旧档案页正是它最擅长处理的输入。安装三个平台各一条命令macOS终端里执行brew install ocrmypdf一条命令带齐依赖。Debian / Ubuntuapt install ocrmypdf即可。Windows推荐走 WSLWindows 自带的 Linux 子系统让你在 Windows 里跑一套 Linux 环境先装好 tesseract 识别引擎再执行pip install ocrmypdf。装完如果缺依赖程序启动时会直接报错并告诉你缺什么、怎么补不会让你猜。3 分钟跑通第一个可搜索 PDF装好后把这条命令里两个文件名换成你自己的ocrmypdf input.pdf output.pdf这条命令在做的事读入扫描 PDF逐页跑 OCR把识别结果写成隐形文字层输出一个新文件。默认走混合模式——已经有文字层的页直接跳过只给纯图片页补字所以重复处理成本很低。验证方法很简单打开输出文件用 CtrlF 搜一个你确定写在页面上的词。能搜到、能选中就说明文字层写进去了。运行时你会看到上面这样的进度界面先扫描页数然后按页并发执行 OCR截图里是 8 页同时处理再进入图像压缩和 PDF/A 转换阶段最后报告文件的压缩比和合规结果。输出默认是 PDF/A-2——一种为长期归档设计、不依赖插件和字体的 PDF 标准这也是为什么输出文件通常比输入小不少。扫描件是歪的用 deskew 把页掰正歪斜的扫描件会实打实地拉低识别率横着扫出来的页面更是没法读。两个参数分工明确--deskew检测页面文字基线的倾斜角度把轻微歪斜一两度以内的图像旋转回正。--rotate-pages处理整个页面横过来90° 或 270°的情况自动判断并转正。日常建议两个一起开轻微倾斜和整页横放就都覆盖了。扫描件太脏先清背景再识别发黄、阴影、彩色底纹都会干扰识别。两个清洁参数都在识别前处理图像--clean去掉扫描噪点适合噪点明显的旧扫描件。--remove-background把纸张底色整体提亮去除对旧报纸、泛黄文档效果明显。注意一点清理会改变输出里页面图像的外观。如果你的文档要求原样保留就别开这两项宁可识别率低一点。中英文混排用 -l 指定语言默认只识别英文eng。中文文档要指定chi_sim简体或chi_tra繁体且系统里需要先装对应的 tesseract 语言包方法见 docs/languages.md。一个文件里同时出现两种语言时用加号并列写-l engchi_sim。如果识别结果里乱码成片九成是语言包没装或语言选错先查这里再怀疑工具。文件大、要长期存放内置优化与归档三个常用旋钮--optimize后跟 1 到 3数字越大压缩越狠、文件越小3 是最高强度。--image-dpi控制输出中图像的分辨率屏幕看 150 左右通常够用打印需求再调高。--jobs指定并发页数多核机器上处理大文档能明显提速。输出标准用--output-type调整可选 auto、pdfa-1、pdfa-2、pdfa-3 或 none。不确定就保持默认的 auto。两个实用配方手机拍出来的歪照片一步变成规整文档ocrmypdf --deskew --rotate-pages --image-dpi 300 phone_photo.jpg searchable.pdf这条命令在做的事接收手机拍的文档照片掰正倾斜、把横页转正按 300 DPI 输出一个可搜索 PDF。图片jpg、png可以直接作为输入不需要先转 PDF。要文本做后续编辑顺带输出一份纯文本ocrmypdf -l engchi_sim --sidecar notes.txt input.pdf output.pdf这条命令在做的事生成可搜索 PDF 的同时把识别出的文字另存为一份 txt 文件方便直接贴进编辑器或做统计。如果是整个文件夹的档案要批量处理写个脚本循环目录里的文件、统一加--deskew就行项目里现成的 misc/batch.py 就是干这个的照着改很省事。还有个更省心的玩法misc/watcher.py 可以盯着一个目录你把扫描件丢进去它自动处理。四个常见坑提前知道能省时间原图分辨率太低神仙难救。扫描源低于 200 DPI 时再好的工具也认不全字。条件允许就按 300 DPI 重新扫只能用低清件时--oversample可以在识别前先把分辨率提上去试试。乱码先查语言包。见上面-l那节这是最高频的故障。Windows 下先确认 tesseract 装好了。识别引擎是外部依赖程序找不到它会直接报缺失不会静默跳过。有文字层的页默认不重做。默认混合模式会跳过已有文字的页如果你就是想整份重新识别加--force-ocr。接下来做什么先挑你手边最麻烦的一份文件——最歪、最旧、最难读的那种——跑一遍带--deskew --rotate-pages的命令用 CtrlF 验证结果。跑通之后按需读两份文档装语言包看不顺眼的翻 docs/installation.md想把它接进自己的工作流比如定时任务、Python 脚本看 docs/api.md。先把最难的那份搞定其他的都是批量重复动作。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考