關於「PDF 轉文字」
大多數從文書處理軟體、網頁或試算表產生的 PDF,都含有真正的文字:帶有位置資訊的字元,與視覺版面一起儲存。這個工具用 Mozilla 的開放原始碼 PDF 函式庫 pdf.js 讀取這層文字,再以純文字交還給你。你會看到一個帶有複製文字按鈕的畫面預覽,也可以把全部內容存成 UTF-8 .txt 檔,任何文字編輯器都能開啟。
輸出內容會在每一頁的文字前插入一行標記,例如 --- Page 3 ---,讓你知道某段文字來自哪一頁,或刪掉不需要的頁面。因為檔案是 UTF-8,只要 PDF 把文字存成真正的字元,帶重音的字母、希臘文、西里爾字母、中文、日文和其他文字都能完整保留。標題和作者等文件屬性不會包含在內,只有頁面上的文字。
掃描的 PDF 會擷取不到任何內容
用掃描器或手機相機產生的 PDF,通常只是一疊頁面相片。裡面沒有可以擷取的字元,所以結果會是空白的。要從圖片中讀出文字,需要 OCR(光學字元辨識)。這個工具本身不做 OCR,但本站的 PDF OCR 文字辨識可以,而且同樣在你的瀏覽器中執行。開始前可以快速測試一下:用任何檢視器開啟 PDF,試著反白一個字。如果反白會貼齊一個個字母,就代表有文字層。
如何使用「PDF 轉文字」
- 加入 PDF從裝置中選取 PDF,或把它拖到工具上。要求輸入密碼的檔案,必須先解鎖才能讀取裡面的文字。
- 檢查擷取出的文字按「擷取文字」後,文字會逐頁顯示在預覽中,以 --- Page N --- 行分隔。快速瀏覽一下,確認閱讀順序合理。
- 複製或儲存 .txt 檔按「複製文字」把所有文字放到剪貼簿,或下載成 UTF-8 文字檔,方便搜尋、編輯或貼到其他地方。
常見使用情境
引用一段文字,不用重新打字
需要把合約、研究報告或使用手冊中的一段話放進電子郵件或報告?擷取文字後,依頁面標記找到正確的頁面,只貼上你需要的部分。
搜尋或比對長篇文件
.txt 檔可以在任何編輯器中搜尋,也能用 diff 工具和先前的草稿逐行比對,或載入試算表、程式中進行計數和排序。
把文字交給其他 App
翻譯工具、筆記 App 和聊天助理,接受純文字比接受 PDF 更容易。貼上擷取出的文字,你就能只分享選定的段落,而不必上傳整份原始檔案。
閱讀順序與版面
文字會依照它在 PDF 內部儲存的順序輸出,這通常(但不一定)和人閱讀的順序一致。信件、報告和多數電子書這類單欄文件,擷取結果都很乾淨。有兩欄或三欄、側欄、圖說或浮動文字方塊的版面則可能交錯:左欄的一行後面接著右欄的一行,或是圖說出現在段落中間。
純文字不包含格式。粗體、斜體、字級、顏色和圖片都會被捨棄,表格也會變成以空格或換行分隔的一串文字,而不是整齊的儲存格。如果頁面外觀比字元更重要,PDF 轉 PNG 產生的圖片能完整保留版面,只是以像素的形式。
為什麼沒有解析度設定
pd00 上把頁面轉成圖片的工具會要你選 72、150 或 300 DPI,因為它們要把每一頁畫成像素網格。擷取文字則完全不需要繪製任何東西。它直接讀取儲存的字元,所以沒有解析度可選,也沒有品質損失:你得到的就是 PDF 裡原本的文字。產生的檔案也很輕巧,因為 .txt 只存字元,沒有字型或圖片,通常比原本的 PDF 小得多。
輸出結果看起來不對時
- 什麼都沒有。這個 PDF 是掃描檔或圖片匯出的檔案,只有 OCR 能幫上忙。請先把檔案交給 PDF OCR 文字辨識,加上隱藏的文字層,再用這個工具擷取文字。
- 出現奇怪的符號,而不是文字。有些 PDF 內嵌的字型,缺少從繪製出的字形對應回真正字元的對照表。頁面在螢幕上看起來沒問題,但儲存的代碼離開那個字型就沒有意義,所以只能用 OCR 還原文字。
- 單字被拆開或黏在一起。PDF 依位置把文字分成片段擺放,所以可能出現多餘或缺少的空格,在左右對齊的段落或字距拉開的標題中特別常見。
- 檔案已上鎖。請用 PDF 解鎖移除密碼(你必須知道密碼),再進行擷取。
只需要文件的一部分?
這個文字工具會處理整個檔案。如果是一本 400 頁的手冊,而你只要其中一章,請先用擷取 PDF 頁面或分割 PDF 把它切出來,再把這份較短的 PDF 交給這裡處理。
你的文字保持私密
PDF 在你的瀏覽器分頁中解析,文字也在你的裝置上產生;不論是檔案或擷取出的文字,都不會上傳到任何地方。這對合約、醫療文件和其他機密文件來說很重要。請依照隱私權頁面上的步驟自行確認。