關於「PDF 轉 Markdown」
PDF 會記錄每一段文字在頁面上的位置和大小,但很少說明哪一行是標題、哪幾行屬於同一個清單。這個轉換工具用 pdf.js 讀取文字層,自行做出這些判斷,再把結果寫成 Markdown:
- 標題是從字級比內文大的文字推測出來的。
- 清單來自以項目符號或數字開頭的行,會轉成項目符號清單或編號清單。
- 段落會重新接合:PDF 在右邊界斷開的行會重新連在一起,不會每隔十幾個字就硬換行一次。
- 換頁以水平分隔線
---標示。
Markdown 會顯示在頁面上的預覽中。複製文字按鈕可以把全部內容放到剪貼簿,你也可以存成 .md 檔。輸出結果是純文字,任何編輯器都能開啟,也能直接放進使用 Markdown 的 Wiki、筆記 App 和說明文件網站。
把結構當成初稿
輸出中的每個標題和清單,都是從視覺線索推論出來的。以內文字級加粗的標題,可能會變成普通的一行;而用大字排版的引言,則可能被當成標題。在依賴結果之前先瀏覽一下預覽,長篇或設計感很重的文件尤其如此。
如何使用「PDF 轉 Markdown」
- 載入含有文字的 PDF選擇 PDF 或拖到工具上。檔案需要有文字層:如果在 PDF 檢視器中無法反白文字,表示這是掃描檔,應該先經過 PDF OCR 文字辨識。
- 看過一遍預覽重建好的 Markdown 會顯示在頁面上。確認標題和清單都出現在預期的位置,有分欄或表格的文件尤其要注意。
- 複製或保留 .md 檔按「複製文字」把 Markdown 貼到編輯器、Wiki 或聊天中,或下載成 .md 檔,和你的其他筆記放在一起。
常見使用情境
把舊手冊搬進 Wiki
一份只剩 PDF 的產品指南,可以變成 Markdown 頁面,章節標題和步驟清單都完整保留,接著就能拆成各個主題,在你的說明文件系統中編輯。
編輯原始檔已遺失的報告
原本的文書處理檔案不見了的時候,Markdown 能給你保有大綱結構的可編輯文字。修改完成後,再用 Markdown 轉 PDF 產生一份新的 PDF。
把長篇文件交給 AI 助理
聊天助理很容易讀懂 Markdown,標題記號也能告訴它們每個段落屬於哪一個章節。只貼上需要的章節,而不是附上整份 PDF。
表格、圖片和多欄頁面
表格不會重建成 Markdown 表格。在 PDF 裡,表格只是放在特定座標上的文字,沒有記錄哪些是列、哪些是儲存格,所以儲存格的內容會變成一行行獨立的文字。重要的表格請手動重建,或用 PDF 轉 PNG 保留頁面的完整圖像。
圖片不會包含在 Markdown 中。要保留相片、圖表和插圖,請用擷取 PDF 圖片把它們存下來,再自行在 Markdown 中加上連結。
多欄版面(例如電子報和學術論文)可能會交錯,相鄰欄位的行交替出現。從文書處理軟體或網頁匯出的單欄文件,轉出的結果最乾淨。
掃描檔需要先有文字層
掃描的 PDF 只有頁面圖片、沒有字元,所以這個工具沒有東西可以讀取,Markdown 會是空的。請先把檔案交給 PDF OCR 文字辨識,它會辨識文字並加上看不見的文字層,再把新檔案帶回這裡。OCR 本身也有錯誤率,所以請校對結果中的人名和數字。
Markdown、純文字還是圖片:該選哪種輸出
會保留什麼,以及在哪裡處理
字元會完全照 PDF 儲存的樣子轉過來,不會因為解析度或壓縮而有任何損失。Markdown 無法描述的部分則會留在原處:字型、顏色、間距,以及元素在頁面上的確切位置。產生的 .md 檔很小,因為裡面只有文字和少數格式符號。如果檔案上了鎖,請用 PDF 解鎖清除密碼(你需要知道密碼),再轉換解鎖後的副本。
轉換在這個瀏覽器分頁內進行,PDF 和 Markdown 都不會上傳;你可以用幾個步驟自行確認。