↑ ↓ 移動 · Enter 開啟 · Esc 關閉

擷取 PDF 中的文字

把 PDF 裡的文字取出來,直接複製或存成純文字 .txt 檔。擷取在你的瀏覽器中進行,文件始終留在你的裝置上。

在你的裝置上執行——檔案絕不上傳。 如何驗證

將 PDF 拖放到這裡 或 選擇檔案 一次一個 PDF

關於「PDF 轉文字」

大多數從文書處理軟體、網頁或試算表產生的 PDF,都含有真正的文字:帶有位置資訊的字元,與視覺版面一起儲存。這個工具用 Mozilla 的開放原始碼 PDF 函式庫 pdf.js 讀取這層文字,再以純文字交還給你。你會看到一個帶有複製文字按鈕的畫面預覽,也可以把全部內容存成 UTF-8 .txt 檔,任何文字編輯器都能開啟。

輸出內容會在每一頁的文字前插入一行標記,例如 --- Page 3 ---,讓你知道某段文字來自哪一頁,或刪掉不需要的頁面。因為檔案是 UTF-8,只要 PDF 把文字存成真正的字元,帶重音的字母、希臘文、西里爾字母、中文、日文和其他文字都能完整保留。標題和作者等文件屬性不會包含在內,只有頁面上的文字。

掃描的 PDF 會擷取不到任何內容

用掃描器或手機相機產生的 PDF,通常只是一疊頁面相片。裡面沒有可以擷取的字元,所以結果會是空白的。要從圖片中讀出文字,需要 OCR(光學字元辨識)。這個工具本身不做 OCR,但本站的 PDF OCR 文字辨識可以,而且同樣在你的瀏覽器中執行。開始前可以快速測試一下:用任何檢視器開啟 PDF,試著反白一個字。如果反白會貼齊一個個字母,就代表有文字層。

如何使用「PDF 轉文字」

  1. 加入 PDF從裝置中選取 PDF,或把它拖到工具上。要求輸入密碼的檔案,必須先解鎖才能讀取裡面的文字。
  2. 檢查擷取出的文字按「擷取文字」後,文字會逐頁顯示在預覽中,以 --- Page N --- 行分隔。快速瀏覽一下,確認閱讀順序合理。
  3. 複製或儲存 .txt 檔按「複製文字」把所有文字放到剪貼簿,或下載成 UTF-8 文字檔,方便搜尋、編輯或貼到其他地方。

常見使用情境

  • 引用一段文字,不用重新打字

    需要把合約、研究報告或使用手冊中的一段話放進電子郵件或報告?擷取文字後,依頁面標記找到正確的頁面,只貼上你需要的部分。

  • 搜尋或比對長篇文件

    .txt 檔可以在任何編輯器中搜尋,也能用 diff 工具和先前的草稿逐行比對,或載入試算表、程式中進行計數和排序。

  • 把文字交給其他 App

    翻譯工具、筆記 App 和聊天助理,接受純文字比接受 PDF 更容易。貼上擷取出的文字,你就能只分享選定的段落,而不必上傳整份原始檔案。

閱讀順序與版面

文字會依照它在 PDF 內部儲存的順序輸出,這通常(但不一定)和人閱讀的順序一致。信件、報告和多數電子書這類單欄文件,擷取結果都很乾淨。有兩欄或三欄、側欄、圖說或浮動文字方塊的版面則可能交錯:左欄的一行後面接著右欄的一行,或是圖說出現在段落中間。

純文字不包含格式。粗體、斜體、字級、顏色和圖片都會被捨棄,表格也會變成以空格或換行分隔的一串文字,而不是整齊的儲存格。如果頁面外觀比字元更重要,PDF 轉 PNG 產生的圖片能完整保留版面,只是以像素的形式。

為什麼沒有解析度設定

pd00 上把頁面轉成圖片的工具會要你選 72、150 或 300 DPI,因為它們要把每一頁畫成像素網格。擷取文字則完全不需要繪製任何東西。它直接讀取儲存的字元,所以沒有解析度可選,也沒有品質損失:你得到的就是 PDF 裡原本的文字。產生的檔案也很輕巧,因為 .txt 只存字元,沒有字型或圖片,通常比原本的 PDF 小得多。

輸出結果看起來不對時

  • 什麼都沒有。這個 PDF 是掃描檔或圖片匯出的檔案,只有 OCR 能幫上忙。請先把檔案交給 PDF OCR 文字辨識,加上隱藏的文字層,再用這個工具擷取文字。
  • 出現奇怪的符號,而不是文字。有些 PDF 內嵌的字型,缺少從繪製出的字形對應回真正字元的對照表。頁面在螢幕上看起來沒問題,但儲存的代碼離開那個字型就沒有意義,所以只能用 OCR 還原文字。
  • 單字被拆開或黏在一起。PDF 依位置把文字分成片段擺放,所以可能出現多餘或缺少的空格,在左右對齊的段落或字距拉開的標題中特別常見。
  • 檔案已上鎖。請用 PDF 解鎖移除密碼(你必須知道密碼),再進行擷取。

只需要文件的一部分?

這個文字工具會處理整個檔案。如果是一本 400 頁的手冊,而你只要其中一章,請先用擷取 PDF 頁面或分割 PDF 把它切出來,再把這份較短的 PDF 交給這裡處理。

你的文字保持私密

PDF 在你的瀏覽器分頁中解析,文字也在你的裝置上產生;不論是檔案或擷取出的文字,都不會上傳到任何地方。這對合約、醫療文件和其他機密文件來說很重要。請依照隱私權頁面上的步驟自行確認。

常見問題

要怎麼複製 PDF 裡的所有文字?

在這裡加入 PDF,等文字出現後按下複製文字。所有內容(包括頁面標記)都會放到你的剪貼簿。

為什麼擷取出的文字是空的?

這個 PDF 幾乎可以肯定沒有文字層,掃描檔和翻拍的頁面通常都是這樣。試著在 PDF 檢視器中反白一個字:如果什麼都選不到,就沒有文字可以擷取。請先用 PDF OCR 文字辨識工具加上可搜尋的文字層,再回到這裡。

為什麼兩欄的內容混在一起?

工具依照文字在檔案中儲存的順序輸出。在多欄版面中,這個順序可能在欄與欄之間跳來跳去,所以不同欄的行可能會交替出現。

表格、圖片和格式會保留嗎?

不會。.txt 檔只存字元,所以樣式和圖片都會省略,表格的儲存格會變成以空格或換行分隔的文字。

「--- Page N ---」這些行是做什麼用的?

它們標示每一頁的起點,方便你追查引文出自哪一頁。如果不想要,用編輯器的「尋找與取代」功能刪掉即可。

支援英文以外的文字嗎?

支援,只要 PDF 儲存的是正確的 Unicode 字元。輸出為 UTF-8,涵蓋所有主要的書寫系統,從帶重音的拉丁字母到中文和日文都包括在內。

擷取文字時,我的文件會被上傳嗎?

不會。擷取完全在你的瀏覽器中執行,除非你自己把文字貼到別處,否則文字永遠不會離開你的裝置。請參考如何驗證。

最後更新:2026年10月8日