PDF OCR
把扫描版 PDF 变成可搜索、可选中的 PDF。OCR 全程在你的浏览器本地运行,文件不会离开设备。
不上传任何文件
PDF OCR 引擎以 WebAssembly 形式在你的浏览器里运行,扫描件不会被发送到服务器。
看得见识别结果
每个识别出的词都会高亮标在页面上,下载前就能确认识别得对不对。
支持 11 种语言
拉丁字母、西里尔字母与中日韩文字均可识别,中文、日文、韩文、俄文都在其中。
免费,无需注册
不用账号、不加水印、不限页数。唯一的实际限制是你设备的内存。
一句话说明: PDF OCR 会把扫描页面上的文字读出来,再作为一层「看不见的文本层」写回 PDF。页面外观完全不变,但你终于可以搜索、选中和复制它了。这个工具全程在你的浏览器里完成。
扫描版 PDF 为什么会卡住你的工作
客户回传了一份合同,你要找其中一条条款。按下 Ctrl+F,输入关键词,PDF 却告诉你没有结果——可那几个字明明就在屏幕上。
这就是大多数人开始找 PDF OCR 的时刻。文件并没有损坏,它只是从一开始就不包含任何文字。
扫描件是一张图片,不是文档
扫描仪或手机拍下一页纸时,记录的是像素。你看到的字母只是形状,不是字符。在 PDF 阅读器眼里,整页就是一张平铺的图。
没有文字识别,你会失去什么
不能搜索。不能复制粘贴。不能选中引用。读屏软件读不出任何内容。文档管理系统索引到的是一个空文件。这些功能全都依赖页面里存在真正的字符。
哪些场景最难受
签好的合同、纸质发票、收据、病历、学术论文、旧档案。这些恰恰是你日后最需要检索的文件,也恰恰是最常以扫描件形式出现的文件。
PDF OCR 是什么?
PDF OCR 是指把扫描页面图像中的文字识别出来,再作为一层真实但不可见的文本层存回 PDF——页面看起来分毫不差,但你已经可以搜索、选中和复制上面的文字了。
OCR 是光学字符识别(optical character recognition)的缩写。识别引擎观察页面上的形状,把它们与某种语言的字形进行匹配,输出字符以及每个词的精确位置。
看不见的文本层是怎么工作的
识别出的文字会以 PDF 文本渲染模式 3 重新绘制到页面上,这个模式的含义是「绘制这段文字但不显示它」。每个词都恰好压在它在扫描图里的位置之上。
所以一份处理得当的 OCR 文件看上去毫无变化,搜索时却能准确高亮。你选中的是那层看不见的文本,不是图像。
可搜索 PDF 与纯文本提取的区别
什么时候你要的是可搜索 PDF
你需要保留原样——签名、印章、信头、版式。任何需要保持体面或具备法律辨识度的文件,都应该继续以 PDF 形式存在。
什么时候你只要纯文本
你要粘贴进邮件、表格或笔记。那就跳过 PDF,直接取纯文本导出。本工具一次运行同时给你这两样。
OCR 解决不了什么
OCR 只能读出确实存在的内容。它无法还原被扫描糊掉的文字,也不会替你校对。一张歪斜、低分辨率的翻拍页,只会得到同样歪斜、低质量的结果。
三步完成 PDF OCR
整个过程都发生在你自己的机器上。不排队、不上传,也没有等待室。
- 1
打开扫描版 PDF
把文件拖到上方方框里,或从设备中选择。它会直接载入浏览器标签页,完全没有上传这一步。
- 2
选择文档语言
选页面上实际印刷的语言,而不是你的界面语言。引擎会下载一次对应的语言包,之后一直缓存在本地。
- 3
运行 OCR 并下载
逐页看着它处理,检查高亮出的词,然后取走可搜索 PDF 或纯文本。两者都在本地生成。
实用建议 — 语言选择的影响比多数人预想的大。用英语去识别一页德语,每个变元音都会被弄错。如果结果看起来像乱码,原因通常就是语言选错了。
说明 — 首次使用某种语言会下载一个不到 3 MB 的语言包。之后就是即时的,而且可以离线使用。
看看 OCR 到底读出了什么
多数 PDF OCR 工具丢给你一个文件就完事了。你只能先下载、打开 PDF、自己搜一遍,才知道到底成没成。
这很不划算,因为扫描质量差异极大,而 PDF OCR 失败时是悄无声息的。一个默默只有 60% 准确率的工具,和一个 99% 的工具,看上去一模一样。
把文本层显示出来
打开「显示文本层」,每个识别出的词都会直接框在页面上。你看到的,正是写进 PDF 里的内容。
下载之前就看出扫描件好不好
引擎没把握的词会标成红色。把鼠标移到任意方框上,就能看到它实际读成了什么、有多大把握。
整页零星几个红框很正常。如果一页大半是红的,那就说明有问题——通常是语言选错了,或者这份扫描件需要用更高分辨率重扫一次。
有了可搜索 PDF,你能做什么
文本层一旦存在,这份文档在你用到它的每个地方,才开始像一份真正的文档。
在文档内搜索
Ctrl+F 在任何 PDF 阅读器、任何设备上都能用。在 60 页的扫描合同里找一条条款,不再靠手动翻页。
直接复制引用,不用重打
选中一段粘进邮件或报告。不用转录,也不会在途中引入错别字。
让扫描件具备无障碍能力
读屏软件只能读取文本层。对一堆扫描件来说,做 OCR 往往是能带来最大无障碍改善的一步。
把干净的文本喂给其他工具
搜索索引、笔记应用、翻译工具和电子表格需要的都是字符,不是像素。纯文本导出可以直接放进去。
你的扫描件不会离开这个标签页
扫描文档往往是人们手里最敏感的文件:签署过的协议、护照、报税材料、诊断书。为了让它们可被搜索,就把它们上传到一台陌生的服务器——这笔交易实在算不上划算。
本工具把 PDF OCR 引擎以 WebAssembly 形式载入你的浏览器并在其中运行。语言包来自我们的服务器,但你的文档哪儿也不去。页面加载完成后你可以断开网络,它照样能把活干完。
浏览器端 PDF OCR 与上传式 OCR 工具的对比
对私密文档来说,本地处理是更合理的默认选择,但它并非没有代价。下面是诚实的对比。
| 对比项 | 本工具(浏览器内) | 上传式 OCR 工具 |
|---|---|---|
| 文件去了哪里 | 始终不离开你的设备 | 上传到远程服务器 |
| 能否离线使用 | 可以,首次加载之后 | 不行 |
| 文件大小上限 | 受限于你的设备内存 | 受限于服务商的套餐 |
| 是否需要账号 | 不需要 | 文件较大时通常需要 |
| 超大 PDF 的速度 | 较慢——用的是你的 CPU | 较快——用的是他们的服务器 |
| 疑难扫描件的准确率 | 清晰印刷体表现良好 | 往往更好——商用引擎 |
最后两行是实话。面对一份 1998 年的褶皱传真件,调校过的商用 OCR 服务会赢过开源引擎;面对一份 500 页的文件,服务器集群也永远跑得比笔记本快。如果你的文档并不敏感,而且疑难扫描件的准确率比隐私更重要,那就该去用那类服务。
如何获得最好的 OCR 准确率
PDF OCR 的质量,大部分在你按下按钮之前就已经决定了。以下四点解释了绝大多数差距。
- 1
用 300 DPI 以上扫描
这是影响最大的单一因素。150 DPI 时字符边缘开始粘连,72 DPI 时多数引擎只能靠猜。300 DPI 是文字识别的标准目标值。
- 2
先把页面摆正、去脏
页面哪怕只歪两度,准确率也会有可测量的下降。扫歪了就打开「摆正倾斜页面」,发灰或有噪点就打开「去除背景噪点」。
- 3
一次只用一种语言
混合语言包会稀释准确率。一份以英文为主、夹几个法文人名的文档,就按英文来跑。
- 4
先看文本层,必要时重跑
下载前先看看高亮出的词。如果某页满是红框,就换个语言或换个扫描设置再跑一次——反正不花你一分钱。
完整的 PDF 工具套件
探索我们全面的 PDF 工具集合,旨在处理您的所有文档需求
PNG 转 PDF
将 PNG 图片合并为单个可打印的 PDF
JPG 转 PDF
将 JPG 图片转换为 PDF 格式
合并 PDF
将多个 PDF 文件合并为一个
压缩 PDF
高效减小 PDF 文件大小
PDF 转 PNG
将 PDF 页面转换为 PNG 图片
PDF 转 JPG
将 PDF 页面转换为 JPG 图片
PDF 转文本
从 PDF 文件中提取文本内容
拆分 PDF
将 PDF 拆分为单独的页面
编辑 PDF
编辑和注释 PDF 文档
整理 PDF
整理和重新排列 PDF 页面
旋转 PDF
旋转 PDF 页面并永久保存
页码
为 PDF 添加页码并实时预览
PDF 水印
为 PDF 添加文字水印并实时预览
HEIC 转 JPG
将 iPhone 的 HEIC 照片转换为 JPG
删除PDF页面
删掉不需要的页面,下载干净的 PDF
PDF 提取页面
把选中的页面保存为新 PDF 或单独文件
PDF 签名
手绘、键入或上传签名,放置到任意页面
调整PDF大小
把页面尺寸改成 A4、Letter 或自定义大小
裁剪 PDF
修剪页边距、拖拽框选,或一键去除白边
拍平 PDF
把表单变为只读——文字保持可搜索,或锁定为图像
PDF 元数据
查看、编辑或清除作者、标题、日期等元数据
PDF 转灰度
转为灰度或黑白,打印时节省彩色墨水
从 PDF 提取图片
把 PDF 内嵌的照片提取出来,保存为 PNG 或 JPG
WebP 转 PDF
把 WebP 图片转换为 PDF,多张可合并成一个文件
PDF 加密码
在浏览器中为 PDF 设置打开密码,全程本地完成
PDF 解除密码
在浏览器中移除 PDF 的已知密码或限制
HEIC 转 PDF
将 iPhone 的 HEIC 照片转换为 PDF
AVIF 转 PDF
将 AVIF 图片转换为 PDF
TIFF 转 PDF
将 TIFF 图片和扫描件转换为 PDF
BMP 转 PDF
将 BMP 位图转换为 PDF
PDF 文字识别
让扫描版 PDF 可被搜索,全程在浏览器完成
PDF 涂黑
把 PDF 里的敏感内容真正删除,全程在浏览器完成
图片压缩
批量压缩 JPEG、PNG、WebP,全程在浏览器完成
调整图片尺寸
批量调整图片尺寸,内置常用预设,全程在浏览器完成
常见问题
在对扫描件做 PDF OCR 之前,大家都会问这些。
如何免费给 PDF 做 OCR?
在上方打开文件,选好文档语言,按「运行 OCR」即可。 整个过程都在这个浏览器标签页里完成,不收任何费用。你会得到一份可搜索的 PDF 和一份纯文本文件,不用注册账号,也不限页数。
这个 PDF OCR 工具真的免费吗?有什么限制?
真的免费,不限页数,也不加水印。 我们不设配额,因为成本不在我们这边——干活的是你的设备。实际限制来自内存:在较旧的手机上处理超大扫描件可能会耗尽内存,这时候改成按页码范围分批处理就行。
我的文件会被上传到服务器吗?
不会。你的 PDF 始终不离开浏览器。 OCR 引擎是在本地运行的 WebAssembly。从我们这里下载的只有引擎本身和语言包。你可以在页面加载完成后断开网络来验证这一点——OCR 依然能正常工作。
OCR 的准确率有多高?
清晰的印刷文字非常好,手写体和劣质扫描件则明显偏弱。 300 DPI 扫描的普通印刷文字,识别率通常在九成以上。手写、褪色的传真纸、复杂表格和低分辨率翻拍会迅速拉低表现。与其相信一个平均值,不如用文本层视图直接判断你自己这份文档。
可以用 OCR 把扫描版 PDF 转成 Word 吗?
不能直接转——本工具输出的是可搜索 PDF 和纯文本,不是 .docx。 多数情况下你真正需要的其实就是纯文本导出,可以直接粘进文档里。如果你只想要文字本身,我们的 PDF 转文字工具正好覆盖这种场景。
PDF OCR 支持哪些语言?
11 种,涵盖拉丁字母、西里尔字母和中日韩文字。 英语、简体中文、繁体中文、西班牙语、葡萄牙语、德语、法语、意大利语、日语、韩语和俄语。非拉丁文字也能得到完整的文本层,所以中文和俄文扫描件是真正可搜索的,而不是只识别一部分。
为什么第一次运行比第二次慢?
第一次要下载 OCR 引擎和语言包。 之后两者都会缓存在你的浏览器里,所以后续运行会立刻开始,而且不需要联网。换成一种新语言时,会再下载一次那个语言包。
做完 OCR 之后该做什么?
通常是压缩它,或者把文字提取出来。 文本层每页只增加几 KB,但底下的扫描图往往很大。之后再压缩,既能保住可搜索性,又能把体积降下来。