PDF 转文本:功能介绍
由文字处理软件、网页或电子表格生成的 PDF,大多包含真正的文字:带有位置信息的字符,和页面的视觉排版存放在一起。这个工具用 Mozilla 的开源 PDF 库 pdf.js 读取这一文字层,并以纯文本的形式交给你。你会看到一个带复制文本按钮的屏幕预览,也可以把全部内容保存为 UTF-8 编码的 .txt 文件,用任何文本编辑器都能打开。
在每一页的文字前面,输出会插入一行标记,例如 --- Page 3 ---,方便你分辨某段文字来自哪一页,或者删掉不需要的页面。由于文件采用 UTF-8 编码,带重音的字母、希腊文、西里尔文、中文、日文等文字都能完整保留,前提是 PDF 把它们存储为真正的字符。标题、作者等文档属性不会包含在内,输出的只有页面文字。
扫描版 PDF 提取结果为空
扫描仪或手机拍照生成的 PDF,通常只是一叠页面照片。里面没有可以提取的字符,所以结果是空白的。要从图片中读出文字,需要 OCR(光学字符识别)。这个工具本身不做 OCR,但本站的 PDF OCR 文字识别可以,而且同样在你的浏览器中运行。开始之前可以先简单测试一下:用任意阅读器打开 PDF,试着选中一个词。如果选区能精准贴合文字,说明文字层是存在的。
PDF 转文本:使用步骤
- 添加 PDF从设备中选择一个 PDF,或者把它拖到工具上。需要密码才能打开的文件,必须先解密才能读取其中的文字。
- 检查提取出的文字点击“提取文本”后,文字会逐页显示在预览中,页与页之间以 --- Page N --- 行分隔。快速浏览一遍,确认阅读顺序合理。
- 复制或保存为 .txt 文件点击“复制文本”把全部文字放到剪贴板,或者下载为 UTF-8 文本文件,之后可以搜索、编辑或粘贴到别处。
常见使用场景
引用段落而无需重新打字
写邮件或报告时需要合同、研究论文或用户手册里的一段话?提取文字后,根据页码标记找到对应的页,只粘贴你需要的那部分。
搜索或对比长文档
.txt 文件可以在任何编辑器里搜索,可以用比较工具与早先的草稿逐行对比,也可以导入电子表格或脚本中做计数和排序。
把文字交给其他应用
翻译工具、笔记应用和聊天助手接收纯文本比接收 PDF 更方便。粘贴提取出的文字,你可以只分享自己选定的段落,而不必上传整个原始文件。
阅读顺序与版式
文字按照它在 PDF 内部的存储顺序输出,这个顺序通常(但并非总是)和人的阅读顺序一致。信件、报告和大多数电子书这类单栏文档提取效果很干净。而有两三栏、侧边栏、图注或浮动文本框的版式,文字可能交错在一起:左栏的一行后面紧跟右栏的一行,或者一条图注落在段落中间。
纯文本不包含格式。粗体、斜体、字号、颜色和图片都会被丢弃,表格会变成用空格或换行分隔的一串串词语,而不是整齐的单元格。如果页面的外观比文字本身更重要,可以用 PDF 转 PNG 生成图片,它能完整保留版式,只不过是以像素的形式。
为什么没有分辨率设置
pd00 上把页面转成图片的工具会让你选择 72、150 或 300 DPI,因为它们要把每一页画成像素网格。文字提取则完全不绘制任何东西。它直接读取存储的字符,所以没有分辨率可选,也没有质量损失:你得到的正是 PDF 中包含的文字。生成的文件也很轻,因为 .txt 只存字符,不含字体和图片,往往比原来的 PDF 小得多。
输出结果看起来不对时
- 什么都没有提取出来。这个 PDF 是扫描件或由图片导出。这种情况只有 OCR 能帮上忙。先用 PDF OCR 文字识别处理文件,给它加上隐藏的文字层,再用本工具提取文字。
- 出现奇怪的符号而不是文字。有些 PDF 嵌入的字体没有从字形映射回真实字符的对照表。页面在屏幕上显示正常,但存储的编码离开那款字体就毫无意义,所以只能用 OCR 找回文字。
- 词语被拆开或粘在一起。PDF 按位置分片放置文字,所以可能出现多余或缺失的空格,在两端对齐的段落或加了字间距的标题中尤其常见。
- 文件被加密。先用 PDF 解密去掉密码(你必须知道密码),然后再提取。
只需要文档的一部分?
文字提取工具处理的是整个文件。如果是一本 400 页的手册而你只要其中一章,可以先用提取 PDF 页面或拆分 PDF 把它切出来,再把这个较短的 PDF 放到这里处理。
你的文字保持私密
PDF 在你的浏览器标签页中解析,文字在你的设备上生成;文件和提取出的文字都不会上传到任何地方。这对于合同、病历信件和其他机密文件来说很重要。按照隐私页面上的步骤即可确认。