↑ ↓ 选择 · Enter 打开 · Esc 关闭

从 PDF 中提取文字

把 PDF 里的文字提取出来,直接复制或保存为纯文本 .txt 文件。提取在你的浏览器中进行,文档始终留在你的设备上。

在你的设备上运行——文件从不上传。 如何验证

将 PDF 拖到这里 或 选择文件 一次处理一个 PDF

PDF 转文本:功能介绍

由文字处理软件、网页或电子表格生成的 PDF,大多包含真正的文字:带有位置信息的字符,和页面的视觉排版存放在一起。这个工具用 Mozilla 的开源 PDF 库 pdf.js 读取这一文字层,并以纯文本的形式交给你。你会看到一个带复制文本按钮的屏幕预览,也可以把全部内容保存为 UTF-8 编码的 .txt 文件,用任何文本编辑器都能打开。

在每一页的文字前面,输出会插入一行标记,例如 --- Page 3 ---,方便你分辨某段文字来自哪一页,或者删掉不需要的页面。由于文件采用 UTF-8 编码,带重音的字母、希腊文、西里尔文、中文、日文等文字都能完整保留,前提是 PDF 把它们存储为真正的字符。标题、作者等文档属性不会包含在内,输出的只有页面文字。

扫描版 PDF 提取结果为空

扫描仪或手机拍照生成的 PDF,通常只是一叠页面照片。里面没有可以提取的字符,所以结果是空白的。要从图片中读出文字,需要 OCR(光学字符识别)。这个工具本身不做 OCR,但本站的 PDF OCR 文字识别可以,而且同样在你的浏览器中运行。开始之前可以先简单测试一下:用任意阅读器打开 PDF,试着选中一个词。如果选区能精准贴合文字,说明文字层是存在的。

PDF 转文本:使用步骤

  1. 添加 PDF从设备中选择一个 PDF,或者把它拖到工具上。需要密码才能打开的文件,必须先解密才能读取其中的文字。
  2. 检查提取出的文字点击“提取文本”后,文字会逐页显示在预览中,页与页之间以 --- Page N --- 行分隔。快速浏览一遍,确认阅读顺序合理。
  3. 复制或保存为 .txt 文件点击“复制文本”把全部文字放到剪贴板,或者下载为 UTF-8 文本文件,之后可以搜索、编辑或粘贴到别处。

常见使用场景

  • 引用段落而无需重新打字

    写邮件或报告时需要合同、研究论文或用户手册里的一段话?提取文字后,根据页码标记找到对应的页,只粘贴你需要的那部分。

  • 搜索或对比长文档

    .txt 文件可以在任何编辑器里搜索,可以用比较工具与早先的草稿逐行对比,也可以导入电子表格或脚本中做计数和排序。

  • 把文字交给其他应用

    翻译工具、笔记应用和聊天助手接收纯文本比接收 PDF 更方便。粘贴提取出的文字,你可以只分享自己选定的段落,而不必上传整个原始文件。

阅读顺序与版式

文字按照它在 PDF 内部的存储顺序输出,这个顺序通常(但并非总是)和人的阅读顺序一致。信件、报告和大多数电子书这类单栏文档提取效果很干净。而有两三栏、侧边栏、图注或浮动文本框的版式,文字可能交错在一起:左栏的一行后面紧跟右栏的一行,或者一条图注落在段落中间。

纯文本不包含格式。粗体、斜体、字号、颜色和图片都会被丢弃,表格会变成用空格或换行分隔的一串串词语,而不是整齐的单元格。如果页面的外观比文字本身更重要,可以用 PDF 转 PNG 生成图片,它能完整保留版式,只不过是以像素的形式。

为什么没有分辨率设置

pd00 上把页面转成图片的工具会让你选择 72、150 或 300 DPI,因为它们要把每一页画成像素网格。文字提取则完全不绘制任何东西。它直接读取存储的字符,所以没有分辨率可选,也没有质量损失:你得到的正是 PDF 中包含的文字。生成的文件也很轻,因为 .txt 只存字符,不含字体和图片,往往比原来的 PDF 小得多。

输出结果看起来不对时

  • 什么都没有提取出来。这个 PDF 是扫描件或由图片导出。这种情况只有 OCR 能帮上忙。先用 PDF OCR 文字识别处理文件,给它加上隐藏的文字层,再用本工具提取文字。
  • 出现奇怪的符号而不是文字。有些 PDF 嵌入的字体没有从字形映射回真实字符的对照表。页面在屏幕上显示正常,但存储的编码离开那款字体就毫无意义,所以只能用 OCR 找回文字。
  • 词语被拆开或粘在一起。PDF 按位置分片放置文字,所以可能出现多余或缺失的空格,在两端对齐的段落或加了字间距的标题中尤其常见。
  • 文件被加密。先用 PDF 解密去掉密码(你必须知道密码),然后再提取。

只需要文档的一部分?

文字提取工具处理的是整个文件。如果是一本 400 页的手册而你只要其中一章,可以先用提取 PDF 页面或拆分 PDF 把它切出来,再把这个较短的 PDF 放到这里处理。

你的文字保持私密

PDF 在你的浏览器标签页中解析,文字在你的设备上生成;文件和提取出的文字都不会上传到任何地方。这对于合同、病历信件和其他机密文件来说很重要。按照隐私页面上的步骤即可确认。

常见问题

怎样复制 PDF 中的全部文字?

把 PDF 添加到这里,文字显示出来后点击复制文本。所有内容都会进入剪贴板,包括页码标记。

为什么提取出的文字是空的?

这个 PDF 几乎可以肯定没有文字层,扫描件和拍照生成的页面通常都是这样。在 PDF 阅读器中试着选中一个词:如果什么都选不中,就没有文字可以提取。先用 PDF OCR 文字识别工具给它加上可搜索的文字层,然后再回到这里。

为什么两栏的内容混在了一起?

工具按照文字在文件中的存储顺序输出。在多栏版式中,这个顺序可能在各栏之间跳来跳去,所以不同栏的行可能交替出现。

表格、图片和格式会保留吗?

不会。.txt 文件只存储字符,所以样式和图片都会被去掉,表格单元格会变成用空格或换行分隔的词语。

“--- Page N ---”这些行是做什么用的?

它们标出每一页从哪里开始,方便你追溯某段引文出自哪一页。如果不需要,可以用编辑器的查找替换功能把它们删掉。

能处理非英文的文字吗?

能,只要 PDF 存储的是规范的 Unicode 字符。输出为 UTF-8 编码,涵盖所有主要的书写系统,从带重音的拉丁字母到中文和日文都没问题。

提取文字时我的文档会被上传吗?

不会。提取完全在你的浏览器中运行,除非你自己把文字粘贴到别处,否则它们不会离开你的设备。请参阅验证方法。

最后更新:2026年10月8日