PDF 画像抽出について
写真が載っている PDF には、たいていその写真が独立したオブジェクトとして入っています。写真は固有のピクセル寸法で 1 回だけ保存され、レイアウトに合わせた大きさでページ上に配置されているのです。このツールは全ページを順に調べ、見つかったラスター画像を 1 つずつ集めて保存します。そのため、ページ全体のスナップショットではなく、画像そのものが手に入ります。
文書はブラウザ内で Mozilla の pdf.js が開きます。PDF は画像をいくつかの方式で保存でき、普通の JPEG、JPEG 2000、そしてスキャンした書類によく使われる白黒の JBIG2 や CCITT ファクス形式などがあります。pdf.js はそのすべてを通常のピクセルにデコードし、それを PNG(既定、可逆圧縮)または JPG として書き出します。各ファイルには、PDF の名前、ページ番号、そのページで画像が見つかった順番が付き、catalog-p4-2.png のような名前になります。全体は 1 つの ZIP ファイルでダウンロードされます。
ピクセルをデコードしてから保存し直すため、元の圧縮済みのデータがそのまま手に入るわけではありません。PNG はそのピクセルを正確に再現しますが、埋め込まれていた元の画像より大きくなることがよくあります。JPG はコンパクトですが、画像をもう一度圧縮することになります。
PDF 画像抽出の使い方
- PDF を開くPDF をツールにドロップするか、ファイル選択画面から選びます。パスワードでロックされている場合は、先に「PDF パスワード解除」でロックを外してから戻ってきてください。これはパスワードがわかっている場合にのみ可能です。
- PNG か JPG か、サイズの除外設定を選ぶPNG はデコードしたピクセルを正確に保ち、最初から選択されています。JPG は、ファイルの小ささが重要な大きな写真に向いています。「小さな画像(32 px 未満)はスキップ」をオンのままにしておくと、行頭記号、アイコン、飾り罫など 32 × 32 ピクセル未満のものをスキップします。
- 画像をダウンロードする「画像を抽出」を押して ZIP ファイルを保存します。ファイルはページ順に並び、たとえば report-p3-1.png は 3 ページ目で最初に見つかった画像です。複数のページで繰り返し使われている画像は 1 回だけ含まれます。
主な利用シーン
PDF しか残っていない写真を取り戻す
デザイナーは異動し、元の画像フォルダも一緒に行方がわからなくなりました。それでもパンフレットの PDF は共有ドライブに残っています。そんなとき抽出すれば、商品やスタッフの写真を、ファイルに保存されている解像度で取り戻せます。
仕入れ先のカタログから商品写真を取り出す
卸売業者から 120 ページのカタログが 1 つの PDF で届き、画像ファイルは別にもらえませんでした。1 ページずつスクリーンショットを撮るより画像を抽出するほうが効率的で、サイズの除外設定のおかげで小さな行頭記号も結果に混ざりません。
スキャンした文書からページ画像を取り出す
スキャナーアプリの多くは、1 ページにつき 1 枚の画像を包んだだけの PDF を作ります。抽出すれば、ページを描画し直す際の再サンプリングなしに、スキャンしたときの解像度のまま画像が手に入り、写真編集ソフトで傾きを直したり汚れを取ったりできます。
画像の抽出と、ページの画像化の違い
| 項目 | 画像の抽出(このツール) | ページを画像に変換 |
|---|---|---|
| 出力されるもの | 埋め込まれた画像を 1 枚ずつ別ファイルで | 1 ページにつき 1 枚、ページ上のすべてを含む画像 |
| テキスト、ベクターのグラフ、レイアウト | 含まれません | ピクセルに平坦化されて含まれます |
| 解像度 | PDF がその画像について保存している解像度 | 選んだ DPI |
| 使うツール | このページ | PDF → PNG 変換または PDF → JPG 変換 |
ZIP に画像が入っていない理由
- 埋め込みではなく描画されている。グラフ、図、多くのロゴはピクセルではなくベクターの図形なので、取り出せる画像オブジェクトがありません。代わりに PDF → PNG 変換でページを描画し、トリミングしてください。
- 実はテキストだった。スキャンした文書でない限り、文字は画像ではありません。文章そのものが必要なら PDF テキスト抽出を使ってください。
- サイズの除外設定に引っかかった。32 × 32 ピクセルより小さいものは既定でスキップされます。小さなアイコンも必要な場合は、「小さな画像(32 px 未満)はスキップ」のチェックを外してください。
- 繰り返し使われていた。レポートの全ページにあるレターヘッドのロゴは、ページごとではなく 1 つのファイルとして保存されます。
解像度、画質、ファイルサイズ
抽出した画像は、PDF に保存されているピクセル寸法を持っています。これは、ページ上で見える大きさとは異なることがあります。レイアウトによっては大きな写真が小さな枠に縮められていることがあり、その場合はページの表示より細部まで写った画像が手に入ります。また、レイアウト上でトリミングされている写真が全体の姿で出てくることもあります。ファイルには画像全体が残っていて、枠の外の部分を隠しているだけのことが多いためです。一方、画面表示用に書き出された PDF やすでに圧縮された PDF には縮小版しか入っていないことがあり、そこから原寸の元画像を取り戻すことはできません。
写真を PNG で保存すると、PDF 内でのサイズよりかなり大きくなることがよくあります。JPEG のデータを可逆圧縮の形に展開し直しているためです。正確さよりファイルサイズが大事な場合は、出力を JPG に切り替えてください。白黒のスキャン画像は、ほとんどが一様な白と黒の領域でできているので、PNG でも比較的小さく収まる傾向があります。
制限事項とプライバシー
- ロックされた文書は、先に PDF パスワード解除が必要です。
- 画像の多い長い PDF は、端末のメモリ量に左右されます。スマートフォンよりパソコンのほうが余裕をもって処理できます。
- 抽出した画像にも、当然ながら著作権が及びます。
Apple 製品では Safari 16.4 以降、それ以外では最新の Chrome、Edge、Firefox が必要です。PDF も抽出したすべての画像もこのタブの中にとどまり、送信されることはありません。確認方法は確認ガイドで説明しています。