删除 PDF 空白页:功能介绍
空白页混进扫描件的方式很有规律。一叠单面和双面混在一起的纸,用双面模式扫描时,只要某张纸背面没有内容,就会留下一张空白的反面,不规则地散落在文件各处。夹在文档之间的分隔纸会变成空白页,办公软件有时也会因为一个多余的分页符而导出一张空白页。在长文件里手动一页页找,费时费力。这个工具会检查每一页,把它们指出来。
检测是基于视觉的。每一页都会用开源的 PDF 渲染器 pdf.js 以较小的尺寸渲染出来,工具再测量这张图中不接近白色的部分占多少。几乎什么都没有的页面就会被判定为空白页。多少才算“几乎什么都没有”,取决于你选择的灵敏度:严格、标准(默认)或宽松。
工具不会擅自删除任何页面。被判定为空白的页面会在缩略图网格中预先选中,保存之前,你可以点击任意缩略图,把它加入或移出选择。结果会下载为 yourfile-no-blanks.pdf(以你的文件名加上 -no-blanks 命名),原文件保持不变。
删除 PDF 空白页:使用步骤
- 载入扫描件添加你想清理的 PDF。工具会把每一页渲染成缩略图来测量,扫描件越长,耗时越久,在手机上尤其如此。
- 选择灵敏度并检查先从“标准”开始。查看预先选中的缩略图,点击应该保留的页面,再点击被漏掉的空白页。如果选中的页面明显太多或太少,就切换到“严格”或“宽松”。
- 保存清理后的副本点击“删除所选页面”并下载结果,文件名是你的原文件名加上 -no-blanks。你最初的那个 PDF 会原封不动地留在磁盘上。
常见使用场景
混合内容的双面扫描
一整夹往来信件用双面模式过了一遍扫描仪,但只有部分信件背面有字。空白的反面落在随机的位置上,检测器能把它们找出来,你不用逐一查看 120 张缩略图。
批量扫描中的分隔纸
你在送入一大叠纸时,在文档之间夹了空白纸,现在想得到一个连续的文件。“标准”能挑出这些分隔纸,因为它会忽略扫描仪在白纸上记录下的灰尘和小斑点。
导出报告中的空白页
一个电子表格另存为 PDF 后多出了几张完全空白的页面,因为它的打印区域超出了数据范围。对于这种电子文件,用“严格”就够了,因为这些页面是纯白的。
严格、标准和宽松的对比
| 灵敏度 | 视为空白的页面 | 适用于 |
|---|---|---|
| 严格 | 只有真正空白的页面 | 电子文档和非常干净的扫描件 |
| 标准(默认) | 空白页面,即使带有扫描灰尘或小斑点 | 大多数扫描的纸质文件 |
| 宽松 | 还包括只有一个小标记的页面,比如单独一个页码 | 空白页上仍印有页码的打印报告 |
无论使用哪种设置,最终都以缩略图为准。灵敏度只决定初始的选择,每一个选中都可以点一下撤销。
可能骗过检测器的页面
- “宽松”模式下的浅淡内容。浅浅的铅笔字、颜色很淡的签名或非常模糊的印刷,可能只占页面很小的一部分,以至于“宽松”把它算作空白。保存前请检查每一张预先选中的页面,或者改回“标准”。
- 彩色或灰色的纸。测量依据的是接近白色的程度,所以一张空白的彩色纸,或者整体偏灰的扫描件,可能根本不会被选中。
- 透印和深色边缘。薄纸背面的印刷透过来,或者扫描仪盖板没盖严留下的深色条带,都可能让空白页看起来像是有内容。
- “此页有意留白”的提示。只印了这一行字的页面上还是有少量文字。“宽松”可能会选中它,“严格”则会保留它。
检测器漏掉的页面,你可以自己点击选中。如果空白页恰好都是偶数页,删除 PDF 页面的偶数页按钮一步就能把它们全部标记出来。
清理后的文件保留了什么
那些小尺寸的渲染图只用于测量。你保留的页面会原样复制到新文件中,所以文字仍可选中,扫描件保持原有分辨率。它们的顺序不会改变,不过如果删掉的空白页上印有页码,页面上的页码就会在那里跳号。文件减小的幅度大约等于被删页面的大小:在扫描件里,每张空白页仍然是一整页的图片,所以节省的空间可能很明显;而在电子文档里,一张空白页几乎不占空间。
想让结果进一步变小,可以试试压缩 PDF;要整理它的标题或作者字段,请用编辑 PDF 元数据。
加密文件、长扫描件与隐私
设有密码的 PDF 在用 PDF 解密 解除之前无法渲染,而解密需要密码。因为每一页都要绘制一遍,长扫描件的分析时间比短的更长;对于内存较小的手机,一个电脑能轻松处理的超大文件可能会很吃力。渲染、测量和保存全部在你的浏览器标签页里完成,不会上传任何页面;按这些步骤即可核实。