PDF テキスト抽出について
ワープロソフト、ウェブページ、表計算ソフトから作った PDF のほとんどには、本物のテキストが入っています。見た目のレイアウトとは別に、位置情報付きの文字として保存されているのです。このツールは、Mozilla のオープンソース PDF ライブラリ pdf.js でそのテキストレイヤーを読み取り、プレーンテキストとして返します。画面上のプレビューにはテキストをコピーボタンがあり、全文を UTF-8 の .txt ファイルとして保存することもできます。このファイルはどのテキストエディターでも開けます。
出力では、各ページのテキストの前に --- Page 3 --- のような区切り行が入ります。これで、どの文章がどのページから来たのかがわかり、不要なページを削除するのも簡単です。ファイルは UTF-8 なので、PDF が本物の文字として保存している限り、アクセント付きの文字、ギリシャ文字、キリル文字、中国語、日本語などの文字もそのまま取り出せます。タイトルや作成者などの文書のプロパティは含まれず、入るのはページのテキストだけです。
スキャンした PDF は空になります
スキャナーやスマートフォンのカメラで作った PDF は、たいていページの写真を重ねただけのものです。中に取り出せる文字がないので、結果は空になります。画像から文字を読み取るには OCR(光学文字認識)が必要です。このツール自体は OCR を行いませんが、このサイトの PDF OCR(文字認識)なら、同じくブラウザ内で OCR を行えます。始める前に簡単に確かめる方法があります。お好きなビューアーで PDF を開き、単語をドラッグして選択してみてください。選択範囲が文字にぴったり合えば、テキストレイヤーがあります。
PDF テキスト抽出の使い方
- PDF を追加する端末から PDF を選ぶか、ツールにドラッグします。パスワードを求められるファイルは、先にロックを解除しないとテキストを読み取れません。
- 抽出したテキストを確認する「テキストを抽出」を押すと、テキストがページごとに --- Page N --- の行で区切られてプレビューに表示されます。ざっと目を通して、読む順番がおかしくないか確かめましょう。
- コピーするか .txt ファイルで保存する「テキストをコピー」を押すと全文がクリップボードに入ります。UTF-8 のテキストファイルとしてダウンロードすれば、検索や編集をしたり、別の場所に貼り付けたりできます。
主な利用シーン
打ち直さずに文章を引用する
契約書、研究論文、取扱説明書の一段落を、メールや報告書に使いたいときに便利です。テキストを抽出し、区切り行を目印に該当ページを見つけて、必要な部分だけを貼り付けられます。
長い文書を検索・比較する
.txt ファイルならどのエディターでも検索でき、差分ツールで前の版と 1 行ずつ比較したり、表計算ソフトやスクリプトに読み込んで集計や並べ替えをしたりできます。
ほかのアプリに文字を渡す
翻訳ツール、メモアプリ、チャットアシスタントは、PDF よりプレーンテキストのほうが受け付けやすいものです。抽出したテキストを貼り付ければ、元のファイル全体をアップロードせず、選んだ部分だけを共有できます。
読む順番とレイアウト
テキストは PDF の内部に保存されている順番で出力されます。これは多くの場合、人が読む順番と一致しますが、いつもそうとは限りません。手紙、報告書、ほとんどの電子書籍のような 1 段組みの文書はきれいに抽出できます。2 段組みや 3 段組み、サイドバー、図のキャプション、浮動するテキストボックスのあるレイアウトでは、文章が入り混じることがあります。左の段の 1 行のあとに右の段の 1 行が来たり、キャプションが段落の途中に入り込んだりするのです。
プレーンテキストには書式がありません。太字、斜体、文字サイズ、色、画像は取り除かれ、表はきれいなセルではなく、スペースや改行で区切られた単語の並びになります。文字そのものよりページの見た目が大事な場合は、PDF → PNG 変換で画像にすれば、ピクセルとしてではありますがレイアウトをそのまま残せます。
解像度の設定がない理由
pd00 のページを画像にする変換ツールで 72・150・300 DPI を選ぶのは、各ページをピクセルの格子として描画するからです。テキスト抽出は何も描画しません。保存されている文字を直接読み取るので、選ぶべき解像度もなく、品質が落ちることもありません。得られるのは、PDF に入っているテキストそのものです。.txt には文字だけが入り、フォントも画像も含まないため、できるファイルも軽く、元の PDF よりはるかに小さくなることがよくあります。
出力がおかしいとき
- 何も出てこない。その PDF はスキャンか、画像として書き出されたものです。この場合は OCR しかありません。先に PDF OCR(文字認識)にかけて見えないテキストレイヤーを追加してから、このツールでテキストを抽出してください。
- 単語の代わりに奇妙な記号が出る。PDF の中には、描かれた字形から本来の文字への対応表を持たないままフォントを埋め込んでいるものがあります。画面上ではきちんと見えても、保存されている文字コードはそのフォントの外では意味をなさないため、文字を取り戻すには OCR を使うしかありません。
- 単語が途中で切れる、またはくっつく。PDF はテキストを位置に基づいて断片ごとに配置するため、特に両端揃えの段落や字間を広げた見出しでは、余計なスペースが入ったりスペースが抜けたりすることがあります。
- ファイルがロックされている。PDF パスワード解除でパスワードを外してから(パスワードを知っている必要があります)、抽出してください。
文書の一部だけが必要な場合
テキスト抽出はファイル全体が対象です。400 ページのマニュアルから 1 章だけがほしい場合は、先に PDF ページ抽出や PDF 分割でその部分を切り出し、短くなった PDF をこのツールにかけてください。
テキストは外部に出ません
PDF の解析はブラウザのタブ内で行われ、テキストはお使いの端末上で生成されます。ファイルも抽出した文字も、どこにもアップロードされません。契約書、医療関係の書類など、機密性の高い書類を扱うときには大切な点です。プライバシーのページの手順に沿って確認できます。