PDF OCR
Превратите отсканированный PDF в документ с поиском и выделением текста. Распознавание идёт локально в браузере, поэтому файл не покидает ваше устройство.
Ничего не загружается
Движок PDF OCR работает как WebAssembly внутри вашего браузера. Скан никогда не отправляется на сервер.
Видно, что распознано
Каждое распознанное слово подсвечивается прямо на странице — можно проверить результат до скачивания.
11 языков
Поддерживаются латиница, кириллица и иероглифические письменности, включая китайский, японский, корейский и русский.
Бесплатно, без регистрации
Без аккаунта, без водяных знаков, без лимита страниц. Единственное реальное ограничение — память вашего устройства.
Коротко: PDF OCR считывает текст с отсканированной страницы и записывает его обратно в PDF невидимым текстовым слоем. Страница выглядит точно так же, но по ней наконец можно искать, выделять и копировать. Вся работа происходит внутри вашего браузера.
Почему отсканированные PDF ломают работу
Клиент присылает договор. Нужно найти один пункт. Вы жмёте Ctrl+F, вводите слово — и PDF отвечает, что совпадений нет, хотя это слово прямо перед вами на экране.
Именно в этот момент большинство и начинает искать PDF OCR. Документ не сломан. В нём просто изначально не было текста.
Скан — это картинка, а не документ
Когда сканер или камера телефона снимает страницу, он записывает пиксели. Буквы, которые вы видите, — это формы, а не символы. Для программы просмотра PDF вся страница представляет собой одно плоское изображение.
Что теряется без распознавания текста
Нет поиска. Нет копирования. Нет выделения для цитирования. Экранные дикторы не читают ничего. Система документооборота индексирует пустой файл. Всё это работает только тогда, когда на странице есть настоящие символы.
Где это мешает сильнее всего
Подписанные договоры, бумажные счета, чеки, медицинские выписки, научные статьи, старые архивы. Именно эти документы чаще всего приходится искать потом — и именно они чаще всего приходят сканами.
Что такое PDF OCR?
PDF OCR — это распознавание текста с изображения отсканированной страницы и запись его обратно в PDF в виде настоящего, но невидимого текстового слоя: страница выглядит точно так же, но теперь по её словам можно искать, выделять их и копировать.
OCR расшифровывается как оптическое распознавание символов. Движок разбирает формы на странице, сопоставляет их с начертаниями букв конкретного языка и выдаёт символы вместе с точным положением каждого слова.
Как устроен невидимый текстовый слой
Распознанные слова заново отрисовываются на странице в режиме отображения текста 3, что означает «нарисуй этот текст, но не показывай его». Каждое слово ложится ровно поверх своего изображения на скане.
Поэтому корректно обработанный файл выглядит совершенно неизменным и при этом правильно подсвечивается при поиске. Вы выделяете невидимый слой, а не картинку.
PDF с поиском или извлечение обычного текста
Когда нужен PDF с поиском
Когда важно сохранить исходный вид: подписи, печати, бланк, вёрстку. Всё, что должно остаться презентабельным или юридически узнаваемым, стоит оставить в PDF.
Когда достаточно самого текста
Вы вставляете его в письмо, таблицу или заметку. Тогда PDF не нужен — берите выгрузку в обычный текст. Этот инструмент выдаёт и то и другое за один проход.
Чего OCR не исправит
OCR читает то, что есть. Он не восстановит текст, размазанный при сканировании, и не вычитывает за вас. Кривой снимок в низком разрешении даст кривой результат низкого качества.
Как распознать текст в PDF за 3 шага
Весь процесс идёт на вашей машине. Ни очереди, ни загрузки на сервер, ни зала ожидания.
- 1
Откройте отсканированный PDF
Перетащите файл в поле выше или выберите его на устройстве. Он загружается прямо во вкладку браузера — шага отправки на сервер попросту нет.
- 2
Выберите язык документа
Выбирайте язык, напечатанный на странице, а не язык интерфейса. Движок один раз скачает нужный языковой пакет и оставит его в кэше.
- 3
Запустите OCR и скачайте
Следите за обработкой страница за страницей, проверьте подсвеченные слова и заберите PDF с поиском или обычный текст. И то и другое создаётся локально.
Совет — Выбор языка значит больше, чем принято думать. Прогон немецкой страницы английским пакетом испортит каждый умлаут. Если результат похож на бессмыслицу, дело почти всегда в языке.
Примечание — Первый запуск с новым языком скачивает пакет размером менее 3 МБ. Дальше всё происходит мгновенно и работает без интернета.
Посмотрите, что OCR прочитал на самом деле
Большинство инструментов PDF OCR просто отдают файл и желают удачи. Сработало ли — вы узнаете, только скачав его, открыв и поискав самостоятельно.
Это невыгодный обмен: качество сканов различается очень сильно, а PDF OCR проваливается молча. Инструмент, который тихо выдаёт 60 % точности, выглядит ровно так же, как тот, что выдаёт 99 %.
Текстовый слой становится видимым
Включите «Показать текстовый слой» — и каждое распознанное слово окажется в рамке прямо на странице. То, что вы видите, и есть записанное в PDF.
Как распознать плохой скан до скачивания
Слова, в которых движок не уверен, отмечаются красным. Наведите курсор на любую рамку, чтобы увидеть, как он их прочитал и насколько был уверен.
Несколько разбросанных красных рамок — это нормально. Если красной оказалась большая часть страницы, что-то не так: обычно выбран не тот язык или скан нужно переделать в более высоком разрешении.
Что даёт PDF с поиском
Как только появляется текстовый слой, документ начинает вести себя как настоящий документ везде, где вы им пользуетесь.
Поиск внутри документа
Ctrl+F работает в любой программе просмотра PDF и на любом устройстве. Найти пункт в отсканированном договоре на 60 страниц — больше не ручная прокрутка.
Копирование и цитирование без перепечатки
Выделите абзац и вставьте его в письмо или отчёт. Ни переписывания вручную, ни опечаток, возникающих по дороге.
Доступность сканов
Экранные дикторы читают только текстовый слой. Для архива сканов OCR часто оказывается самым весомым улучшением доступности.
Чистый текст для других инструментов
Поисковым индексам, заметочникам, переводчикам и таблицам нужны символы, а не пиксели. Выгрузка в обычный текст подходит им напрямую.
Ваш скан не покидает эту вкладку
Отсканированные документы — обычно самые чувствительные файлы, какие у человека есть: подписанные соглашения, паспорта, налоговые бумаги, медицинские заключения. Отправлять их на незнакомый сервер только ради возможности поиска — странная сделка.
Этот инструмент загружает движок PDF OCR в ваш браузер как WebAssembly и выполняет его там. Языковые пакеты приходят с нашего сервера, но ваш документ никуда не уходит. После загрузки страницы можно отключиться от сети — работа всё равно будет доведена до конца.
PDF OCR в браузере против инструментов с загрузкой на сервер
Для личных документов локальная обработка — правильный выбор по умолчанию, но не без компромиссов. Вот честное сравнение.
| Критерий | Этот инструмент (в браузере) | OCR-сервисы с загрузкой |
|---|---|---|
| Куда попадает файл | Никогда не покидает устройство | Загружается на удалённый сервер |
| Работа офлайн | Да, после первой загрузки | Нет |
| Ограничение размера | Определяется памятью устройства | Определяется тарифом сервиса |
| Нужен аккаунт | Нет | Часто — для крупных файлов |
| Скорость на очень больших PDF | Медленнее — используется ваш процессор | Быстрее — используются их серверы |
| Точность на сложных сканах | Хорошая на чистой печати | Часто выше — коммерческие движки |
Последние две строки — не формальность. Коммерческий сервис с отлаженным движком обойдёт открытый на мятом факсе 1998 года, а серверная ферма всегда обгонит ноутбук на файле в 500 страниц. Если документ не конфиденциален и точность на плохом скане важнее приватности, лучше воспользоваться таким сервисом.
Как добиться наилучшей точности OCR
Качество PDF OCR по большей части определяется ещё до нажатия кнопки. Эти четыре пункта объясняют почти всю разницу.
- 1
Сканируйте с разрешением 300 DPI и выше
Это самый весомый отдельный фактор. При 150 DPI края символов начинают сливаться, при 72 DPI большинство движков просто угадывает. 300 DPI — стандартный ориентир для распознавания текста.
- 2
Сначала выровняйте и очистите страницу
Наклон всего в два градуса заметно снижает точность. Для кривых сканов включайте выравнивание, для серых и в крапинку — удаление фона.
- 3
Один язык за проход
Смешение языковых пакетов размывает точность. Если документ в основном английский и в нём лишь несколько французских фамилий, обрабатывайте его как английский.
- 4
Проверьте текстовый слой и запустите заново
Посмотрите на подсвеченные слова до скачивания. Если страница усыпана красными рамками, смените язык или настройки сканирования и повторите — это ничего не стоит.
Полный набор инструментов PDF
Откройте для себя нашу полную коллекцию инструментов PDF для решения любых задач с документами
PNG в PDF
Объедините изображения PNG в один готовый к печати PDF
JPG в PDF
Конвертируйте изображения JPG в формат PDF
Объединить PDF
Объедините несколько файлов PDF в один
Сжать PDF
Эффективно уменьшите размер файла PDF
PDF в PNG
Конвертируйте страницы PDF в изображения PNG
PDF в JPG
Конвертируйте страницы PDF в изображения JPG
PDF в текст
Извлеките текст из файлов PDF
Разделить PDF
Разделите PDF на отдельные страницы
Редактировать PDF
Редактируйте и комментируйте документы PDF
Упорядочить PDF
Упорядочьте и переставьте страницы PDF
Повернуть PDF
Поворачивайте страницы PDF и сохраняйте навсегда
Нумерация страниц
Добавьте нумерацию страниц в PDF с предпросмотром
Водяной знак на PDF
Добавьте текстовый водяной знак на PDF с предпросмотром
HEIC в JPG
Конвертируйте фото HEIC с iPhone в JPG
Удалить страницы PDF
Удалите ненужные страницы и скачайте чистый PDF
Извлечь страницы PDF
Сохраните выбранные страницы как новый PDF или отдельные файлы
Подписать PDF
Нарисуйте, введите или загрузите подпись и разместите её на любой странице
Изменить размер PDF
Измените размер страницы на A4, Letter или свой формат
Обрезать PDF
Обрежьте поля, выделите область или автоматически удалите пустое пространство
Свести PDF
Сделайте формы доступными только для чтения — сохраните текст для поиска или зафиксируйте как изображение
Метаданные PDF
Просматривайте, редактируйте или удаляйте автора, заголовок, даты и другие метаданные
PDF в оттенки серого
Преобразуйте в оттенки серого или чёрно-белый, чтобы сэкономить цветные чернила
Извлечь изображения из PDF
Извлеките встроенные фото из PDF и сохраните как PNG или JPG
WebP в PDF
Конвертируйте изображения WebP в PDF, объедините несколько в один файл
Защитить PDF
Добавьте пароль на открытие PDF полностью в вашем браузере
Снять пароль с PDF
Снимите известный пароль или ограничения с PDF прямо в браузере
HEIC в PDF
Конвертируйте фото HEIC с iPhone в PDF
AVIF в PDF
Конвертируйте изображения AVIF в PDF
TIFF в PDF
Конвертируйте изображения и сканы TIFF в PDF
BMP в PDF
Конвертируйте изображения BMP в PDF
OCR PDF
Сделайте отсканированный PDF доступным для поиска, прямо в браузере
Закрасить в PDF
Навсегда удалите конфиденциальный текст из PDF, прямо в браузере
Сжать изображение
Уменьшайте JPEG, PNG и WebP пакетно, прямо в браузере
Изменить размер
Меняйте размеры пакетно, с готовыми пресетами, прямо в браузере
Частые вопросы
Всё, что спрашивают перед запуском PDF OCR на скане.
Как бесплатно распознать текст в PDF?
Откройте файл выше, выберите язык документа и нажмите «Запустить OCR». Весь процесс идёт в этой вкладке браузера и ничего не стоит. Вы получаете PDF с поиском и текстовый файл, без аккаунта и без ограничения по страницам.
Этот инструмент PDF OCR действительно бесплатный? В чём ограничение?
Он бесплатный, без лимита страниц и без водяных знаков. Мы не вводим квоты, потому что расходы несём не мы — работает ваше устройство. Реальное ограничение — память: очень большой скан на старом телефоне может её исчерпать, и тогда лучше обрабатывать по диапазонам страниц.
Мои файлы загружаются на сервер?
Нет. Ваш PDF не покидает браузер. Движок OCR — это WebAssembly, работающий локально. От нас скачиваются только сам движок и языковой пакет. Проверить легко: отключите сеть после загрузки страницы — распознавание продолжит работать.
Насколько точен PDF OCR?
Очень хорошо на чистом печатном тексте, слабее на рукописном и плохих сканах. Скан обычного печатного текста в 300 DPI распознаётся, как правило, выше девяноста процентов. Рукописный текст, выцветшая факсовая бумага, плотные таблицы и снимки в низком разрешении быстро ухудшают результат. Судите по своему документу через просмотр текстового слоя, а не по средним цифрам.
Можно ли с помощью OCR превратить скан PDF в Word?
Напрямую нет: инструмент выдаёт PDF с поиском и обычный текст, а не .docx. В большинстве случаев нужна как раз текстовая выгрузка — её можно сразу вставить в документ. Если нужен только текст сам по себе, эту задачу закрывает наш инструмент «PDF в текст».
Какие языки поддерживает PDF OCR?
Одиннадцать — латиница, кириллица и иероглифические письменности. Английский, китайский упрощённый и традиционный, испанский, португальский, немецкий, французский, итальянский, японский, корейский и русский. Нелатинские письменности получают полноценный текстовый слой, поэтому китайские и русские сканы действительно доступны для поиска целиком, а не частично.
Почему первый запуск медленнее второго?
При первом запуске скачиваются движок OCR и языковой пакет. Дальше оба лежат в кэше браузера, поэтому следующие запуски начинаются сразу и работают без сети. Переход на новый язык один раз подгружает соответствующий пакет.
Что делать после распознавания PDF?
Обычно сжать его или извлечь текст. Текстовый слой добавляет всего несколько килобайт на страницу, но сам скан под ним часто весит немало. Сжатие после OCR сохраняет возможность поиска и уменьшает размер файла.
Похожие инструменты
Что ещё можно сделать с тем же документом.
- PDF в текст — извлеките текст из PDF, в котором текстовый слой уже есть.
- Сжать PDF — уменьшите скан после OCR, не потеряв текстовый слой.
- PDF в PNG — выгрузите страницы картинками, если хотите доработать их перед повторным сканированием.
- PDF в оттенки серого — уберите цвет с шумного скана — это нередко улучшает распознавание.
- Объединить PDF — соберите несколько отсканированных страниц в один документ перед запуском OCR.
- Закрасить в PDF — удалите конфиденциальные места, когда скан станет доступным для поиска.
Сделайте сканы доступными для поиска
Запустите OCR для PDF прямо здесь, в браузере. Без загрузки на сервер, без аккаунта, без лимита страниц.
Открыть инструмент PDF OCR