PDF 是「什么都能装」的容器格式,这份便利同时也是它的麻烦:同一个扩展名下可能是电子件、扫描件、带权限的文档、甚至只是几张图片。多数 PDF 相关的求助最终落在四类问题上——打不开、搜不到、太大、合并后乱了。
本文按这四类展开。工具清单见站内的 PDF 使用指南,这里补的是判断依据与处理顺序。
先分清:电子件还是扫描件
这是所有 PDF 处理的第一个分岔,因为它决定后续每一步的可行路径。
电子件有真实的文字层。文字可以被复制、搜索、编辑,文件体积小。它通常由文字处理器或排版软件生成。
扫描件本质是图片。看起来有文字,是因为 OCR(光学字符识别)在图片上跑了一遍,把识别结果作为不可见的文字层附着在图片上。这个文字层有三大特性:
- 准确率 85%–98%,取决于扫描质量与字体
- 错误集中在低频字符、标点和数字 —— 汉字与常用字母识别得好,
l/O/1/0这类混淆得厉害 - 不可编辑 —— 在阅读器里选中文字复制出来的是 OCR 的猜测结果,不是原文
判断方法很简单:试着选中并复制一段文字。复制不出来或复制出乱码,多半是扫描件;能正常复制且文字正确,就是电子件。
这个分岔直接影响能力边界:需要编辑 PDF 内容,就必须先 OCR,而 OCR 的质量决定了后续所有操作的上限。
打不开还是不能复制:两种密码
PDF 的加密常被误解成一个开关,实际上是两层。
| 类型 | 决定什么 | 表现 |
|---|---|---|
| owner password(所有者密码) | 能否打开文件 | 不给就进不去 |
| user password(用户密码) | 打开后能做什么 | 能打开但禁止打印/复制 |
所以「文档打不开」和「文档能开但复制不了」是两个完全不同的问题。前者需要 owner password(本站的 PDF 加密工具 可以设置),后者只是权限限制。
移除 owner password 必须提供原密码 —— 这是格式的设计,不是工具的缺陷。本站的 PDF 解密工具 适用于已知密码的场景;忘记密码的加密 PDF 在密码学上不可破解,只能回到备份。
另一个容易踩的点:某些 PDF 声称「已加密」其实只是设了权限密码,文件本身是能正常打开的。用专门的检测手段先确认是哪一种,再决定处理方式。
搜不到:OCR 文字层不可靠
扫描件的搜索行为有个隐蔽特征:它似乎能用,但结果不可信。
具体到症状:搜 lO1(小写 L、大写 O、数字 1)找不到本该命中的 101,因为 OCR 把某个 1 认成了字母 l。搜人名可能命中形近字。复制出来的编号做数据处理会得到错乱的数字——因为 OCR 把 0 认成 O、把 1 认成 l。
分两种目标处理:
归档检索 → 用图像级搜索。它对整页做视觉匹配或对版面做结构化识别,不依赖 OCR 的逐字结果,反而更可靠。
内容编辑 → 先 OCR,然后人工抽查关键字段。金额、编号、日期是错误后果最严重的三类。抽查比例按业务风险定:如果是财务凭证,抽查比例可能要高得多。
太大:压图片
扫描件 PDF 的体积构成很极端:约 95% 是图片,文字层只占几十 KB。
这解释了为什么通用的「压缩文档」往往无效——它优化的是字体嵌入、对象结构和元数据,而这些本来就只占微不足道的比例。真正的杠杆在内嵌图片上:
- 分辨率从 300dpi 降到 150dpi(印刷级降到屏幕级,肉眼几乎无差别)
- 无损 PNG 换成有损 JPEG(质量 0.6–0.8)
- 单色扫描件(如纯文字合同)转成灰度或位图
这三项合起来通常能降 60%–80%。本站的 PDF 压缩工具 走的就是图片级压缩路线。
一个容易忽略的坑:有些工具的默认选项只做结构压缩,需要显式选择「图像压缩」那一档,否则你会发现压了半天体积几乎没变。
合并与拆分:书签和链接的牺牲品
合并 PDF 时最容易出问题的不是页序,而是结构信息。
原文档里的书签(outline)、章节跳转、表单域值、以及指向文内其他位置的链接,都依赖文档内部的页码与对象引用。简单工具的合并方式是把页面对象堆到一起,这些引用就全乱了:
- 书签可能指向错误的页码(更糟的是指向一个存在但无关的页)
- 内部链接跳到别处或失效
- 表单域值丢失
处理顺序:
- 用支持结构化操作的工具(明确保留 outline)
- 合并后逐个点击验证书签与链接
- 如果原文档之间有交叉引用,放弃合并 —— 改为在网页或文档系统里提供多个独立 PDF 加一个索引页,这比修链接可靠得多
拆分(用 PDF 裁剪工具 或按页拆)同样受影响,因为它可能重排页码。拆完后如果原文档有书签,需要确认书签是否还能对应。
自查清单
- [ ] 先判断是电子件还是扫描件(试着选中并复制文字)
- [ ] 分清是 owner password 挡着打不开,还是 user password 限制操作
- [ ] 归档检索用图像级搜索,不依赖 OCR 文字层
- [ ] 内容编辑前先 OCR,并人工抽查金额/编号/日期
- [ ] 压缩时压图片(降 dpi + 换 JPEG),不是压文档结构
- [ ] 合并后逐个验证书签与内部链接;跨文档互链考虑不合并
- [ ] 拆分后确认原书签是否仍对应
可复现的实测结果
用本站的 PDF 加密工具 分别设置两层密码后,可以直接观察:只设 user password 时文件仍能打开但打印被禁用;加上 owner password 后不提供密码就打不开。本站的 PDF 提取工具 对电子件能提取出完整文字,对扫描件只能拿到 OCR 结果——这个差异本身就是判断文件类型的手段。