PDF 转文本
提取 PDF 中的文字层,导出可编辑的 txt
选择文件
本地读取,不上传服务器
点击选择文件
或拖拽到此处,文件仅在本地处理
处理设置
调好参数再开始
处理结果
生成后可立即下载
使用说明
📖 工具介绍
把 PDF 里的文字取出来变成可编辑文本的工具。上传后点一下,原文就出现在下面的文本框里,可以复制走,也可以下载成 txt 文件。
这里做的是直接读取 PDF 内嵌的文字层,不是图像识别。所以它对「电子版 PDF」效果最好——就是那种文字能选中、能复制的文件,提取出来一字不差,还能保留原有的换行位置。但它对扫描件无效:扫描出来的 PDF 本质上是一张张图片,里面根本没有文字层,提取结果会是空的,这时工具会明确提示你是扫描件并建议改用 OCR,而不是给你一片空白让你以为坏了。
可以只提取其中几页,在起始页和结束页填上序号即可,留空就是整本。提取时按页面原有的行位置断行,段落结构大体保留,但复杂的多栏排版可能会串在一起,需要你自己再整理一下。
全程浏览器本地处理,文件不上传。对于合同、报告这类需要把内容搬到别处继续编辑的场景,这比手打一遍省事得多。
如果提取结果里有大量乱码或者缺字,通常有两个原因。一是原 PDF 用了嵌入子集字体,字符映射不完整,这时换用 OCR 工具处理反而更可靠;二是原文件本身就是扫描件,那就必须走识别这条路。判断方法还是那一条:原文能不能用鼠标选中文字,能选中却出现乱码是字体映射问题,选不中就是扫描件。
提取出来的文字可以直接粘进 Word、笔记软件或者翻译工具里继续用。相比手打一遍,最实在的好处是零错字——因为是直接读取而不是重新识别。如果原文件是中英混排,文字层里两种语言都会保留,不会因为语言混合就丢内容。
✨ 功能特点
- 直接读取内嵌文字层,电子版 PDF 提取一字不差
- 可选页码范围,只提取需要的那几页
- 按原有行位置断行,段落结构大体保留
- 结果可一键复制到剪贴板,也可下载为 txt
- 扫描件会明确提示无文字层并引导改用 OCR
- 浏览器本地处理,文件不上传服务器
🚀 使用方式
- 点上传区域选择一个 PDF,或把文件拖进来
- 需要只取部分页时填写起始页与结束页,留空则提取全部
- 点「开始处理」,等待进度条走完
- 在结果框里检查文字是否正确
- 点「复制文本」直接粘贴到别处,或点「下载结果」存为 txt
⚠️ 注意事项
- 扫描件提取不到内容:扫描的 PDF 只有图像没有文字层,请用 OCR 工具处理
- 多栏排版可能串栏:报纸杂志类的复杂版面文字顺序可能错乱,需要自行整理
- 不保留图片与表格:只取文字,图片、表格线、样式都不会出现在结果里
- 超大文件受内存限制:页数极多时处理较慢,可能超出内存限制
- 结果不保留在服务器:产物只在这台设备上,刷新后需要重新处理