PDF 转 Markdown:功能介绍
PDF 记录的是每一段文字在页面上的位置和字号,却很少说明哪一行是标题、哪几行属于一个列表。这个转换器用 pdf.js 读取文字层,自己做出这些判断,再把结果写成 Markdown:
- 标题:根据字号明显大于正文的文字推断出来。
- 列表:以项目符号或数字开头的行,会变成无序或有序列表项。
- 段落:会重新连接起来,PDF 在右侧页边距处断开的行会重新连成一段,不会每隔十几个词就出现一个硬换行。
- 分页:用一条水平分隔线
---标出。
Markdown 会显示在页面上的预览区中。复制文本按钮可以把全部内容放到剪贴板,你也可以保存为 .md 文件。输出是纯文本,用任何编辑器都能打开,可以直接放进使用 Markdown 的 Wiki、笔记应用和文档网站。
把结构当作初稿看待
输出中的每个标题和列表,都是根据视觉线索推断出来的。用粗体但与正文同字号的标题,可能会变成普通的一行;而一段字号较大的醒目引文,则可能被当成标题。使用之前先浏览一遍预览,篇幅长或设计复杂的文档尤其要注意。
PDF 转 Markdown:使用步骤
- 载入带文字的 PDF选择一个 PDF 或把它拖到工具上。它需要有文字层:如果在 PDF 阅读器里无法选中文字,说明这是扫描件,应该先经过 PDF OCR 文字识别处理。
- 通读预览点击“转换为 Markdown”后,重建好的 Markdown 会显示在页面上。检查标题和列表是否落在你预期的位置,带分栏或表格的文档尤其要留意。
- 复制或保存 .md 文件点击“复制文本”,把 Markdown 粘贴到编辑器、Wiki 或聊天窗口中;或者下载为 .md 文件,和你的其他笔记放在一起。
常见使用场景
把旧手册搬进 Wiki
一份只剩 PDF 版本的产品指南,可以变成保留章节标题和步骤列表的 Markdown 页面,方便拆分成多个主题,在你的文档系统中编辑。
编辑源文件已丢失的报告
原始的文字处理文档丢了,Markdown 能给你一份大纲完整、可以编辑的文字。改好之后,再用 Markdown 转 PDF 生成一份新的 PDF。
把长文档交给 AI 助手
聊天助手很容易读懂 Markdown,标题标记还能告诉它每一段属于哪个章节。只粘贴你需要的章节,而不是把整个 PDF 作为附件上传。
表格、图片和多栏页面
表格不会被重建为 Markdown 表格。在 PDF 内部,表格只是放在不同坐标上的文字,没有任何行或单元格的记录,所以单元格内容会变成一行行独立的文字。重要的表格请手动重建,或者用 PDF 转 PNG 保留页面的原样图片。
图片不会出现在 Markdown 中。要保留照片、图表和插图,请用提取 PDF 图片把它们保存下来,再自己在 Markdown 中添加链接。
多栏版式(比如简报和学术论文)的文字可能交错在一起,相邻栏的行交替出现。从文字处理软件或网页导出的单栏文档效果最干净。
扫描件需要先有文字层
扫描版 PDF 里只有页面图片,没有字符,所以这个工具没有内容可读,生成的 Markdown 是空的。先用 PDF OCR 文字识别处理文件,它会识别文字并添加一层不可见的文字层,然后把新文件拿回这里转换。OCR 本身也有一定的错误率,所以请校对结果中的人名和数字。
Markdown、纯文本还是图片:该选哪种输出
哪些内容会保留,处理在哪里进行
字符会按 PDF 存储的原样转出,不会因为分辨率或压缩而损失任何内容。Markdown 无法描述的东西则不会带过去:字体、颜色、间距,以及元素在页面上的精确位置。生成的 .md 文件很小,因为它只包含文字和少量格式符号。如果文件被加密,先用 PDF 解密去掉密码(你需要知道密码),再转换解密后的副本。
转换在这个浏览器标签页中进行,PDF 和 Markdown 都不会被上传;你只需几步就能自己确认。