提取 PDF 图片:功能介绍
一个显示照片的 PDF,通常把这张照片作为独立对象存储:只存一份,有自己的像素尺寸,再按版式需要的大小放到页面上。这个工具会逐页查找,收集找到的每一张位图并逐个保存,所以你得到的是图片本身,而不是整页的快照。
文档由 Mozilla 的 pdf.js 在你的浏览器中打开。PDF 可以用多种编码存储图片,包括普通 JPEG、JPEG 2000,以及扫描文件中常见的黑白 JBIG2 和 CCITT 传真格式。pdf.js 会把它们全部解码成普通像素,再写出为 PNG(默认,无损)或 JPG。每个文件以 PDF 名称、页码和该页中图片被找到的顺序命名,例如 catalog-p4-2.png,全部图片打包成一个 ZIP 压缩包下载。
由于像素是先解码再重新保存的,你拿到的不是原始的压缩字节。PNG 能精确还原这些像素,但往往比内嵌的原图更大;JPG 体积小,但会对图片进行第二次压缩。
提取 PDF 图片:使用步骤
- 打开 PDF把 PDF 拖到工具上,或者用文件选择器选取。如果文件有密码保护,先用 PDF 解密去掉密码再回到这里,前提是你知道密码。
- 选择 PNG 或 JPG 以及尺寸过滤PNG 能精确保留解码后的像素,默认选中。如果更在意文件小,JPG 适合大尺寸照片。保持勾选“跳过小图(小于 32 px)”,可以跳过所有小于 32 × 32 像素的图片,比如项目符号、图标和装饰线。
- 下载图片点击“提取图片”,然后保存 ZIP 压缩包。文件按页面顺序排列,比如 report-p3-1.png 就是第 3 页找到的第一张图片;在多个页面重复出现的图片只收录一次。
常见使用场景
只剩 PDF 时找回照片
设计师已经离职,原始图片文件夹也跟着没了,但共享盘上还留着宣传册的 PDF。提取功能能按文件中存储的分辨率,把产品照片和团队合影找回来。
从供应商目录中获取产品图
批发商发来一份 120 页的目录,只有一个 PDF,没有单独的图片文件。把图片直接提取出来,比逐页截图强得多,尺寸过滤还能把细小的项目符号挡在结果之外。
从扫描文档中取出页面扫描图
很多扫描应用生成的 PDF 只是给每页包了一张图片。提取能按原始扫描分辨率交还这些扫描图,不会经过页面渲染带来的重新采样,可以直接在图片编辑器里拉直或清理。
提取图片与把页面转成图片的区别
| 问题 | 提取图片(本工具) | 把页面转成图片 |
|---|---|---|
| 输出什么 | 每张内嵌图片各成一个文件 | 每页一张图片,包含页面上的所有内容 |
| 文字、矢量图表、版式 | 不包含 | 包含,扁平化为像素 |
| 分辨率 | PDF 中这张图片存储的分辨率 | 你选择的 DPI |
| 用哪个工具 | 就在这里 | PDF 转 PNG 或 PDF 转 JPG |
为什么 ZIP 里可能少了某张图片
- 它是绘制的,而不是内嵌的。图表、示意图和许多 Logo 是矢量形状而不是像素,所以没有可以提取的图片对象。这种情况请用 PDF 转 PNG 渲染页面,再进行裁剪。
- 它其实是文字。除非文档是扫描件,否则文字永远不会是图片。需要文字内容本身,请使用 PDF 转文本。
- 被尺寸过滤掉了。默认会跳过所有小于 32 × 32 像素的图片;如果也需要小图标,取消勾选“跳过小图(小于 32 px)”即可。
- 它是重复的。报告每一页上的信头 Logo 只保存为一个文件,而不是每页一个。
分辨率、质量与文件大小
提取出的图片带有 PDF 中存储的像素尺寸,这可能和它在页面上看起来的大小不同。版式可能把一张大照片压进一个小框里,这时你得到的细节会比页面上显示的更多;而被版式裁切的照片可能会完整地提取出来,因为文件常常保存了整张图片,只是把框外的部分隐藏了。为屏幕显示而导出或已经压缩过的 PDF,可能只存有缩小后的副本,原始的全尺寸图片无法从中恢复。
照片存成 PNG 后,往往会比在 PDF 中大很多,因为 JPEG 数据流被解包成了无损格式。如果文件大小比精确还原更重要,就把输出改成 JPG。黑白扫描件存成 PNG 通常仍然比较小,因为它们大部分是纯黑和纯白的区域。
限制与隐私
- 加密的文档需要先用 PDF 解密处理。
- 图片多的长篇 PDF 取决于设备的内存;电脑处理起来比手机从容。
- 你提取出的任何内容仍受版权保护。
在苹果设备上需要 Safari 16.4 或更高版本,其他设备上需要较新版本的 Chrome、Edge 或 Firefox。PDF 和提取出的每张图片都留在这个标签页内,从不传输;验证指南介绍了如何确认。