达达工具

PDF 文字提取

从 PDF 里提取文字,直接复制或保存为 .txt 文件。按页重建文本行,还可以加上页面分隔线。全部在浏览器里完成。

仅在浏览器中处理

文件在浏览器本地处理,不会上传到服务器。

使用方法

上传 PDF,几秒钟后所有页面的文字就会出现在下面的框里。可以一键复制,也可以下载成以原文档命名的 .txt 文件。勾选页面分隔线选项后,每一页前面会插入一行“--- 第 N 页 ---”,这样还能看出页面从哪里开始。

这个工具读取的是 PDF 本身自带的文字层,再根据每个片段在页面上的位置重建文本行。从 Word、Google 文档、LaTeX 或浏览器导出的文档效果很好。不过分栏排版、表格和叠在图片上的文字,出来的顺序可能和阅读顺序不同,使用前请核对一下结果。

扫描出来的 PDF 是一叠照片而不是文字,所以这个工具什么也提取不到。这里没有 OCR 步骤。如果文件来自扫描仪或手机相机,需要先用 OCR 工具识别文字。带密码的 PDF 也打不开,请去掉密码后再试。

文件不会离开你的电脑。提取完全在浏览器里进行,不会上传到任何地方,所以合同、银行对账单和公司内部报告都可以放心处理。

常与它一起使用的工具