← 返回博客首页

PDF 处理实战:加密双密码、扫描件 OCR 与合并丢书签

PDF 是「什么都能装」的容器格式,这份便利同时也是它的麻烦:同一个扩展名下可能是电子件、扫描件、带权限的文档、甚至只是几张图片。多数 PDF 相关的求助最终落在四类问题上——打不开、搜不到、太大、合并后乱了。

本文按这四类展开。工具清单见站内的 PDF 使用指南,这里补的是判断依据与处理顺序。

先分清:电子件还是扫描件

这是所有 PDF 处理的第一个分岔,因为它决定后续每一步的可行路径。

电子件有真实的文字层。文字可以被复制、搜索、编辑,文件体积小。它通常由文字处理器或排版软件生成。

扫描件本质是图片。看起来有文字,是因为 OCR(光学字符识别)在图片上跑了一遍,把识别结果作为不可见的文字层附着在图片上。这个文字层有三大特性:

  1. 准确率 85%–98%,取决于扫描质量与字体
  2. 错误集中在低频字符、标点和数字 —— 汉字与常用字母识别得好,l/O/1/0 这类混淆得厉害
  3. 不可编辑 —— 在阅读器里选中文字复制出来的是 OCR 的猜测结果,不是原文

判断方法很简单:试着选中并复制一段文字。复制不出来或复制出乱码,多半是扫描件;能正常复制且文字正确,就是电子件。

这个分岔直接影响能力边界:需要编辑 PDF 内容,就必须先 OCR,而 OCR 的质量决定了后续所有操作的上限。

打不开还是不能复制:两种密码

PDF 的加密常被误解成一个开关,实际上是两层。

类型 决定什么 表现
owner password(所有者密码) 能否打开文件 不给就进不去
user password(用户密码) 打开后能做什么 能打开但禁止打印/复制

所以「文档打不开」和「文档能开但复制不了」是两个完全不同的问题。前者需要 owner password(本站的 PDF 加密工具 可以设置),后者只是权限限制。

移除 owner password 必须提供原密码 —— 这是格式的设计,不是工具的缺陷。本站的 PDF 解密工具 适用于已知密码的场景;忘记密码的加密 PDF 在密码学上不可破解,只能回到备份。

另一个容易踩的点:某些 PDF 声称「已加密」其实只是设了权限密码,文件本身是能正常打开的。用专门的检测手段先确认是哪一种,再决定处理方式。

搜不到:OCR 文字层不可靠

扫描件的搜索行为有个隐蔽特征:它似乎能用,但结果不可信。

具体到症状:搜 lO1(小写 L、大写 O、数字 1)找不到本该命中的 101,因为 OCR 把某个 1 认成了字母 l。搜人名可能命中形近字。复制出来的编号做数据处理会得到错乱的数字——因为 OCR 把 0 认成 O、把 1 认成 l。

分两种目标处理:

归档检索 → 用图像级搜索。它对整页做视觉匹配或对版面做结构化识别,不依赖 OCR 的逐字结果,反而更可靠。

内容编辑 → 先 OCR,然后人工抽查关键字段。金额、编号、日期是错误后果最严重的三类。抽查比例按业务风险定:如果是财务凭证,抽查比例可能要高得多。

太大:压图片

扫描件 PDF 的体积构成很极端:约 95% 是图片,文字层只占几十 KB。

这解释了为什么通用的「压缩文档」往往无效——它优化的是字体嵌入、对象结构和元数据,而这些本来就只占微不足道的比例。真正的杠杆在内嵌图片上:

  • 分辨率从 300dpi 降到 150dpi(印刷级降到屏幕级,肉眼几乎无差别)
  • 无损 PNG 换成有损 JPEG(质量 0.6–0.8)
  • 单色扫描件(如纯文字合同)转成灰度或位图

这三项合起来通常能降 60%–80%。本站的 PDF 压缩工具 走的就是图片级压缩路线。

一个容易忽略的坑:有些工具的默认选项只做结构压缩,需要显式选择「图像压缩」那一档,否则你会发现压了半天体积几乎没变。

合并与拆分:书签和链接的牺牲品

合并 PDF 时最容易出问题的不是页序,而是结构信息。

原文档里的书签(outline)、章节跳转、表单域值、以及指向文内其他位置的链接,都依赖文档内部的页码与对象引用。简单工具的合并方式是把页面对象堆到一起,这些引用就全乱了:

  • 书签可能指向错误的页码(更糟的是指向一个存在但无关的页)
  • 内部链接跳到别处或失效
  • 表单域值丢失

处理顺序:

  1. 用支持结构化操作的工具(明确保留 outline)
  2. 合并后逐个点击验证书签与链接
  3. 如果原文档之间有交叉引用,放弃合并 —— 改为在网页或文档系统里提供多个独立 PDF 加一个索引页,这比修链接可靠得多

拆分(用 PDF 裁剪工具 或按页拆)同样受影响,因为它可能重排页码。拆完后如果原文档有书签,需要确认书签是否还能对应。

自查清单

  • [ ] 先判断是电子件还是扫描件(试着选中并复制文字)
  • [ ] 分清是 owner password 挡着打不开,还是 user password 限制操作
  • [ ] 归档检索用图像级搜索,不依赖 OCR 文字层
  • [ ] 内容编辑前先 OCR,并人工抽查金额/编号/日期
  • [ ] 压缩时压图片(降 dpi + 换 JPEG),不是压文档结构
  • [ ] 合并后逐个验证书签与内部链接;跨文档互链考虑不合并
  • [ ] 拆分后确认原书签是否仍对应

可复现的实测结果

用本站的 PDF 加密工具 分别设置两层密码后,可以直接观察:只设 user password 时文件仍能打开但打印被禁用;加上 owner password 后不提供密码就打不开。本站的 PDF 提取工具 对电子件能提取出完整文字,对扫描件只能拿到 OCR 结果——这个差异本身就是判断文件类型的手段。


广告

常见问题

PDF 加密里的 owner password 和 user password 有什么区别?

**它们管的是完全不同的两件事。** owner password(所有者密码)决定能不能打开文件——不给就进不去;user password(用户密码)只决定打开后能做什么,允许你打开但禁止打印或复制。日常遇到的「文档打不开」是前者,「文档能开但复制不了」是后者,**排查时必须先分清是哪一种**。本站的 [PDF 加密工具](/pdf-encrypt.html) 可以分别设置这两层。反过来也有 [PDF 解密工具](/pdf-decrypt.html) 处理已加密的文件——但注意移除 owner password 需要原密码,这是设计上的限制,不是工具缺陷。

扫描件 PDF 能直接搜索吗?

**能搜,但结果不可信。** 扫描件本质是图片,那层能搜的文字是 OCR 识别出来的,准确率通常 85%–98%,错误集中在低频字符、标点和数字上。实际后果很具体:搜 `lO1`(字母 l、字母 O、数字 1)找不到本该命中的 `101`;把 OCR 文字复制出来做数据处理会得到错乱的编号。**如果只是归档检索**,用图像级搜索工具(对整页做视觉匹配)而不是依赖文字层;**如果要做内容编辑**,必须先 OCR 并人工抽查关键字段——金额、编号、日期,这三类错了后果最严重。

20MB 的 PDF 压到 5MB,用哪个工具设置?

**压图片,不是压文档结构。** 扫描件里通常 95% 的体积是图片,文字层只占几十 KB,所以通用的「压缩文档」选项(优化字体、合并对象、去掉元数据)几乎不改变体积。有效做法是重新压缩内嵌图片:把 300dpi 降到 150dpi,或把无损 PNG 换成有损 JPEG,体积能降 60%–80% 而肉眼几乎看不出差别。本站的 [PDF 压缩工具](/pdf-compress.html) 提供的正是图片级压缩。另外注意有些工具的默认选项只做结构压缩,需要手动选「图像压缩」那一档。

合并多个 PDF 后目录和内部链接都失效了,能修吗?

**链接失效能修,目录错位很难修。** 简单工具合并时会丢弃原文档的 outline(书签)与指向文内位置的链接,合并后书签可能指向错误的页码。用支持结构化操作的工具(保留 outline)可以保住大部分,合并后**务必逐个点击验证**。如果原文档之间有交叉引用(互链),建议放弃合并,改为在网页或文档系统里提供多个独立 PDF 加一个索引页——这比修链接更可靠。另一个实用做法是合并后用 [PDF 提取工具](/pdf-extract.html) 导出文本,人工核对章节顺序是否符合预期。

← 返回博客首页