Распознать текст из скана или фото

Достаём текст оттуда, где его нет как текста: из отсканированного документа, из PDF без текстового слоя, из фотографии страницы. Результат можно править, искать по нему и копировать.

С чего начать

Снимок читается также из TIFF, BMP, GIF и WEBP — выберите нужную пару на главной. Отдельно включать распознавание не нужно нигде: если извлекать нечего, файл уходит в него сам.

Как это происходит

Сначала проверяется, есть ли в файле готовый текст. У PDF, сделанного из документа, он есть — тогда текст берётся как есть, мгновенно и без искажений, и распознавание не запускается вовсе. У скана и фотографии текстового слоя нет, и включается Tesseract с русским и английским словарями сразу.

Страницы разбираются по 300 точек на дюйм — ниже этого точность падает резко, — и обрабатываются по несколько штук одновременно. Предел одной задачи 200 страниц: ограничение не в размере файла, а во времени, которое отведено обработчику.

Перевёрнутый лист

Положение страницы определяется само, и для каждой отдельно. Это не мелочь: движок распознавания читает буквы в том положении, в каком их нашёл, — на перевёрнутом листе он не отказывает и не жалуется, а добросовестно выдаёт «Дата 12.08.2026» как «9202'80'2| е1е1». Ошибка попадала бы человеку в файл, а не в журнал.

Поэтому лист, отсканированный вверх ногами или боком, разворачивается перед распознаванием, а в пачке сканов один поехавший лист не тянет за собой остальные. Если определить положение уверенно не удалось, страница остаётся как есть: неверный поворот ровной страницы хуже, чем неповёрнутая кривая.

Что получится, а что нет

Из скана выходит текст: абзацы и деление на страницы на месте, а таблиц, колонок и картинок оригинала нет. Восстанавливать их не из чего — в растре нет ничего, кроме точек. Так же поступают все, кто работает со сканами, и это несравнимо лучше отказа: человеку нужен редактируемый текст, а не точная копия картинки.

Рукописный текст не распознаётся вовсе — словари обучены на печатных шрифтах. Декоративные и рукописные гарнитуры читаются плохо. И главное про качество: ровный кадр, рассеянный свет и отсутствие бликов дают почти безошибочный результат, а тень от руки, мятая бумага и блик от лампы портят распознавание сильнее, чем низкое разрешение. Повёрнутый кадр сюда не относится — с ним разберётся сам сервис.

Вопросы

Чем распознавание отличается от обычной конвертации?
Обычная конвертация переписывает текст, который в файле уже есть. В скане и фотографии текста нет — есть точки, из которых он складывается для глаза. Распознавание читает эти точки и превращает в буквы, поэтому результат зависит от качества снимка, а не только от формата.
Нужно ли что-то включать?
Нет. Отсутствие текстового слоя определяется само: если в PDF нечего извлекать, файл уходит в распознавание без отдельной кнопки.
Что будет с перевёрнутой страницей?
Она развернётся перед распознаванием, и каждая страница проверяется отдельно — в пачке сканов один перевёрнутый лист не потянет за собой остальные. Если определить положение уверенно не удалось, страница остаётся как есть: неверный поворот ровной страницы хуже, чем неповёрнутая кривая.
На каких языках?
Русский и английский одновременно, выбирать не нужно. Двуязычный документ распознаётся целиком.
Распознаётся ли рукописный текст?
Нет. Движок обучен на печатных шрифтах; рукописный и декоративные шрифты он читает плохо.
Сколько страниц можно за раз?
До 200. Ограничение не в объёме файла, а во времени: распознавание идёт по 300 точек на дюйм, и очень длинный скан не должен занимать обработчик дольше отведённого ему срока.
Сохранится ли таблица из скана?
Нет. Из растра восстанавливать нечего: распознанное ложится в документ обычным текстом — абзацы и страницы на месте, таблиц, колонок и картинок оригинала нет. Это свойство скана, а не ограничение сервиса. Если исходный PDF был сделан из документа, а не отснят, таблицы сохранятся — путь выбирается сам.

Распознавание бесплатно и без регистрации, как и остальная конвертация. Загруженные файлы и результаты удаляются автоматически — подробности в политике конфиденциальности.