在浏览器中运行

PDF OCR

把扫描版 PDF 变成可搜索、可选中的 PDF。OCR 全程在你的浏览器本地运行,文件不会离开设备。

本地处理0 上传约 1.2 秒无需账号

不上传任何文件

PDF OCR 引擎以 WebAssembly 形式在你的浏览器里运行,扫描件不会被发送到服务器。

看得见识别结果

每个识别出的词都会高亮标在页面上,下载前就能确认识别得对不对。

支持 11 种语言

拉丁字母、西里尔字母与中日韩文字均可识别,中文、日文、韩文、俄文都在其中。

免费,无需注册

不用账号、不加水印、不限页数。唯一的实际限制是你设备的内存。

一句话说明: PDF OCR 会把扫描页面上的文字读出来,再作为一层「看不见的文本层」写回 PDF。页面外观完全不变,但你终于可以搜索、选中和复制它了。这个工具全程在你的浏览器里完成。

扫描版 PDF 为什么会卡住你的工作

客户回传了一份合同,你要找其中一条条款。按下 Ctrl+F,输入关键词,PDF 却告诉你没有结果——可那几个字明明就在屏幕上。

这就是大多数人开始找 PDF OCR 的时刻。文件并没有损坏,它只是从一开始就不包含任何文字。

扫描件是一张图片,不是文档

扫描仪或手机拍下一页纸时,记录的是像素。你看到的字母只是形状,不是字符。在 PDF 阅读器眼里,整页就是一张平铺的图。

没有文字识别,你会失去什么

不能搜索。不能复制粘贴。不能选中引用。读屏软件读不出任何内容。文档管理系统索引到的是一个空文件。这些功能全都依赖页面里存在真正的字符。

哪些场景最难受

签好的合同、纸质发票、收据、病历、学术论文、旧档案。这些恰恰是你日后最需要检索的文件,也恰恰是最常以扫描件形式出现的文件。

PDF OCR 是什么?

PDF OCR 是指把扫描页面图像中的文字识别出来,再作为一层真实但不可见的文本层存回 PDF——页面看起来分毫不差,但你已经可以搜索、选中和复制上面的文字了。

OCR 是光学字符识别(optical character recognition)的缩写。识别引擎观察页面上的形状,把它们与某种语言的字形进行匹配,输出字符以及每个词的精确位置。

看不见的文本层是怎么工作的

识别出的文字会以 PDF 文本渲染模式 3 重新绘制到页面上,这个模式的含义是「绘制这段文字但不显示它」。每个词都恰好压在它在扫描图里的位置之上。

所以一份处理得当的 OCR 文件看上去毫无变化,搜索时却能准确高亮。你选中的是那层看不见的文本,不是图像。

可搜索 PDF 与纯文本提取的区别

什么时候你要的是可搜索 PDF

你需要保留原样——签名、印章、信头、版式。任何需要保持体面或具备法律辨识度的文件,都应该继续以 PDF 形式存在。

什么时候你只要纯文本

你要粘贴进邮件、表格或笔记。那就跳过 PDF,直接取纯文本导出。本工具一次运行同时给你这两样。

OCR 解决不了什么

OCR 只能读出确实存在的内容。它无法还原被扫描糊掉的文字,也不会替你校对。一张歪斜、低分辨率的翻拍页,只会得到同样歪斜、低质量的结果。

三步完成 PDF OCR

整个过程都发生在你自己的机器上。不排队、不上传,也没有等待室。

  1. 1

    打开扫描版 PDF

    把文件拖到上方方框里,或从设备中选择。它会直接载入浏览器标签页,完全没有上传这一步。

  2. 2

    选择文档语言

    选页面上实际印刷的语言,而不是你的界面语言。引擎会下载一次对应的语言包,之后一直缓存在本地。

  3. 3

    运行 OCR 并下载

    逐页看着它处理,检查高亮出的词,然后取走可搜索 PDF 或纯文本。两者都在本地生成。

实用建议语言选择的影响比多数人预想的大。用英语去识别一页德语,每个变元音都会被弄错。如果结果看起来像乱码,原因通常就是语言选错了。

说明首次使用某种语言会下载一个不到 3 MB 的语言包。之后就是即时的,而且可以离线使用。

看看 OCR 到底读出了什么

多数 PDF OCR 工具丢给你一个文件就完事了。你只能先下载、打开 PDF、自己搜一遍,才知道到底成没成。

这很不划算,因为扫描质量差异极大,而 PDF OCR 失败时是悄无声息的。一个默默只有 60% 准确率的工具,和一个 99% 的工具,看上去一模一样。

把文本层显示出来

打开「显示文本层」,每个识别出的词都会直接框在页面上。你看到的,正是写进 PDF 里的内容。

下载之前就看出扫描件好不好

引擎没把握的词会标成红色。把鼠标移到任意方框上,就能看到它实际读成了什么、有多大把握。

整页零星几个红框很正常。如果一页大半是红的,那就说明有问题——通常是语言选错了,或者这份扫描件需要用更高分辨率重扫一次。

有了可搜索 PDF,你能做什么

文本层一旦存在,这份文档在你用到它的每个地方,才开始像一份真正的文档。

在文档内搜索

Ctrl+F 在任何 PDF 阅读器、任何设备上都能用。在 60 页的扫描合同里找一条条款,不再靠手动翻页。

直接复制引用,不用重打

选中一段粘进邮件或报告。不用转录,也不会在途中引入错别字。

让扫描件具备无障碍能力

读屏软件只能读取文本层。对一堆扫描件来说,做 OCR 往往是能带来最大无障碍改善的一步。

把干净的文本喂给其他工具

搜索索引、笔记应用、翻译工具和电子表格需要的都是字符,不是像素。纯文本导出可以直接放进去。

你的扫描件不会离开这个标签页

扫描文档往往是人们手里最敏感的文件:签署过的协议、护照、报税材料、诊断书。为了让它们可被搜索,就把它们上传到一台陌生的服务器——这笔交易实在算不上划算。

本工具把 PDF OCR 引擎以 WebAssembly 形式载入你的浏览器并在其中运行。语言包来自我们的服务器,但你的文档哪儿也不去。页面加载完成后你可以断开网络,它照样能把活干完。

浏览器端 PDF OCR 与上传式 OCR 工具的对比

对私密文档来说,本地处理是更合理的默认选择,但它并非没有代价。下面是诚实的对比。

对比项本工具(浏览器内)上传式 OCR 工具
文件去了哪里始终不离开你的设备上传到远程服务器
能否离线使用可以,首次加载之后不行
文件大小上限受限于你的设备内存受限于服务商的套餐
是否需要账号不需要文件较大时通常需要
超大 PDF 的速度较慢——用的是你的 CPU较快——用的是他们的服务器
疑难扫描件的准确率清晰印刷体表现良好往往更好——商用引擎

最后两行是实话。面对一份 1998 年的褶皱传真件,调校过的商用 OCR 服务会赢过开源引擎;面对一份 500 页的文件,服务器集群也永远跑得比笔记本快。如果你的文档并不敏感,而且疑难扫描件的准确率比隐私更重要,那就该去用那类服务。

如何获得最好的 OCR 准确率

PDF OCR 的质量,大部分在你按下按钮之前就已经决定了。以下四点解释了绝大多数差距。

  1. 1

    用 300 DPI 以上扫描

    这是影响最大的单一因素。150 DPI 时字符边缘开始粘连,72 DPI 时多数引擎只能靠猜。300 DPI 是文字识别的标准目标值。

  2. 2

    先把页面摆正、去脏

    页面哪怕只歪两度,准确率也会有可测量的下降。扫歪了就打开「摆正倾斜页面」,发灰或有噪点就打开「去除背景噪点」。

  3. 3

    一次只用一种语言

    混合语言包会稀释准确率。一份以英文为主、夹几个法文人名的文档,就按英文来跑。

  4. 4

    先看文本层,必要时重跑

    下载前先看看高亮出的词。如果某页满是红框,就换个语言或换个扫描设置再跑一次——反正不花你一分钱。

所有工具 100% 免费且安全

完整的 PDF 工具套件

探索我们全面的 PDF 工具集合,旨在处理您的所有文档需求

工具索引 · 34
01

PNG 转 PDF

将 PNG 图片合并为单个可打印的 PDF

Avg 1.2s本地
02

JPG 转 PDF

将 JPG 图片转换为 PDF 格式

Avg 1.4s本地
03

合并 PDF

将多个 PDF 文件合并为一个

Avg 0.8s本地
04

压缩 PDF

高效减小 PDF 文件大小

Avg 2.1s本地
05

PDF 转 PNG

将 PDF 页面转换为 PNG 图片

Avg 1.6s本地
06

PDF 转 JPG

将 PDF 页面转换为 JPG 图片

Avg 1.5s本地
07

PDF 转文本

从 PDF 文件中提取文本内容

Avg 0.9s本地
08

拆分 PDF

将 PDF 拆分为单独的页面

Avg 0.6s本地
09

编辑 PDF

编辑和注释 PDF 文档

Beta本地
10

整理 PDF

整理和重新排列 PDF 页面

Avg 0.7s本地
11

旋转 PDF

旋转 PDF 页面并永久保存

Avg 0.5s本地
12

页码

为 PDF 添加页码并实时预览

Avg 0.6s本地
13

PDF 水印

为 PDF 添加文字水印并实时预览

Avg 0.6s本地
14

HEIC 转 JPG

将 iPhone 的 HEIC 照片转换为 JPG

Avg 1.0s本地
15

删除PDF页面

删掉不需要的页面,下载干净的 PDF

Avg 0.5s本地
16

PDF 提取页面

把选中的页面保存为新 PDF 或单独文件

Avg 0.5s本地
17

PDF 签名

手绘、键入或上传签名,放置到任意页面

Avg 1.0s本地
18

调整PDF大小

把页面尺寸改成 A4、Letter 或自定义大小

Avg 0.6s本地
19

裁剪 PDF

修剪页边距、拖拽框选,或一键去除白边

Avg 0.6s本地
20

拍平 PDF

把表单变为只读——文字保持可搜索,或锁定为图像

Avg 0.7s本地
21

PDF 元数据

查看、编辑或清除作者、标题、日期等元数据

Avg 0.4s本地
22

PDF 转灰度

转为灰度或黑白,打印时节省彩色墨水

Avg 1.8s本地
23

从 PDF 提取图片

把 PDF 内嵌的照片提取出来,保存为 PNG 或 JPG

Avg 0.9s本地
24

WebP 转 PDF

把 WebP 图片转换为 PDF,多张可合并成一个文件

Avg 0.7s本地
25

PDF 加密码

在浏览器中为 PDF 设置打开密码,全程本地完成

Avg 0.3s本地
26

PDF 解除密码

在浏览器中移除 PDF 的已知密码或限制

Avg 1.5s本地
27

HEIC 转 PDF

将 iPhone 的 HEIC 照片转换为 PDF

Avg 0.8s本地
28

AVIF 转 PDF

将 AVIF 图片转换为 PDF

Avg 0.7s本地
29

TIFF 转 PDF

将 TIFF 图片和扫描件转换为 PDF

Avg 1.0s本地
30

BMP 转 PDF

将 BMP 位图转换为 PDF

Avg 0.7s本地
31

PDF 文字识别

让扫描版 PDF 可被搜索,全程在浏览器完成

Avg 2s/page本地
32

PDF 涂黑

把 PDF 里的敏感内容真正删除,全程在浏览器完成

Avg 0.3s/page本地
33

图片压缩

批量压缩 JPEG、PNG、WebP,全程在浏览器完成

Avg 0.2s本地
34

调整图片尺寸

批量调整图片尺寸,内置常用预设,全程在浏览器完成

Avg 0.2s本地

常见问题

在对扫描件做 PDF OCR 之前,大家都会问这些。

如何免费给 PDF 做 OCR?

在上方打开文件,选好文档语言,按「运行 OCR」即可。 整个过程都在这个浏览器标签页里完成,不收任何费用。你会得到一份可搜索的 PDF 和一份纯文本文件,不用注册账号,也不限页数。

这个 PDF OCR 工具真的免费吗?有什么限制?

真的免费,不限页数,也不加水印。 我们不设配额,因为成本不在我们这边——干活的是你的设备。实际限制来自内存:在较旧的手机上处理超大扫描件可能会耗尽内存,这时候改成按页码范围分批处理就行。

我的文件会被上传到服务器吗?

不会。你的 PDF 始终不离开浏览器。 OCR 引擎是在本地运行的 WebAssembly。从我们这里下载的只有引擎本身和语言包。你可以在页面加载完成后断开网络来验证这一点——OCR 依然能正常工作。

OCR 的准确率有多高?

清晰的印刷文字非常好,手写体和劣质扫描件则明显偏弱。 300 DPI 扫描的普通印刷文字,识别率通常在九成以上。手写、褪色的传真纸、复杂表格和低分辨率翻拍会迅速拉低表现。与其相信一个平均值,不如用文本层视图直接判断你自己这份文档。

可以用 OCR 把扫描版 PDF 转成 Word 吗?

不能直接转——本工具输出的是可搜索 PDF 和纯文本,不是 .docx。 多数情况下你真正需要的其实就是纯文本导出,可以直接粘进文档里。如果你只想要文字本身,我们的 PDF 转文字工具正好覆盖这种场景。

PDF OCR 支持哪些语言?

11 种,涵盖拉丁字母、西里尔字母和中日韩文字。 英语、简体中文、繁体中文、西班牙语、葡萄牙语、德语、法语、意大利语、日语、韩语和俄语。非拉丁文字也能得到完整的文本层,所以中文和俄文扫描件是真正可搜索的,而不是只识别一部分。

为什么第一次运行比第二次慢?

第一次要下载 OCR 引擎和语言包。 之后两者都会缓存在你的浏览器里,所以后续运行会立刻开始,而且不需要联网。换成一种新语言时,会再下载一次那个语言包。

做完 OCR 之后该做什么?

通常是压缩它,或者把文字提取出来。 文本层每页只增加几 KB,但底下的扫描图往往很大。之后再压缩,既能保住可搜索性,又能把体积降下来。

相关工具

对同一份文档,你可能还想做这些。

  • PDF 转文字 从本来就有文本层的 PDF 中提取纯文字。
  • PDF 压缩 OCR 之后压缩扫描件,同时保住文本层。
  • PDF 转 PNG 把页面导出为图片,便于重扫前先做修整。
  • PDF 转灰度 去掉噪点扫描件的颜色,常能提升识别效果。
  • PDF 合并 先把多页扫描件合成一份文档,再统一做 OCR。
  • PDF 涂黑 扫描件变得可搜索之后,再把敏感内容彻底删掉。

让你的扫描件可被搜索

直接在浏览器里对 PDF 做 OCR。无需上传,无需账号,不限页数。

打开 PDF OCR 工具
免费 PDF OCR — 让扫描版 PDF 可搜索