Распознать текст из скана или фото
Достаём текст оттуда, где его нет как текста: из отсканированного документа, из PDF без текстового слоя, из фотографии страницы. Результат можно править, искать по нему и копировать.
С чего начать
Снимок читается также из TIFF, BMP, GIF и WEBP — выберите нужную пару на главной. Отдельно включать распознавание не нужно нигде: если извлекать нечего, файл уходит в него сам.
Как это происходит
Сначала проверяется, есть ли в файле готовый текст. У PDF, сделанного из документа, он есть — тогда текст берётся как есть, мгновенно и без искажений, и распознавание не запускается вовсе. У скана и фотографии текстового слоя нет, и включается Tesseract с русским и английским словарями сразу.
Страницы разбираются по 300 точек на дюйм — ниже этого точность падает резко, — и обрабатываются по несколько штук одновременно. Предел одной задачи 200 страниц: ограничение не в размере файла, а во времени, которое отведено обработчику.
Перевёрнутый лист
Положение страницы определяется само, и для каждой отдельно. Это не мелочь: движок распознавания читает буквы в том положении, в каком их нашёл, — на перевёрнутом листе он не отказывает и не жалуется, а добросовестно выдаёт «Дата 12.08.2026» как «9202'80'2| е1е1». Ошибка попадала бы человеку в файл, а не в журнал.
Поэтому лист, отсканированный вверх ногами или боком, разворачивается перед распознаванием, а в пачке сканов один поехавший лист не тянет за собой остальные. Если определить положение уверенно не удалось, страница остаётся как есть: неверный поворот ровной страницы хуже, чем неповёрнутая кривая.
Что получится, а что нет
Из скана выходит текст: абзацы и деление на страницы на месте, а таблиц, колонок и картинок оригинала нет. Восстанавливать их не из чего — в растре нет ничего, кроме точек. Так же поступают все, кто работает со сканами, и это несравнимо лучше отказа: человеку нужен редактируемый текст, а не точная копия картинки.
Рукописный текст не распознаётся вовсе — словари обучены на печатных шрифтах. Декоративные и рукописные гарнитуры читаются плохо. И главное про качество: ровный кадр, рассеянный свет и отсутствие бликов дают почти безошибочный результат, а тень от руки, мятая бумага и блик от лампы портят распознавание сильнее, чем низкое разрешение. Повёрнутый кадр сюда не относится — с ним разберётся сам сервис.
Вопросы
- Чем распознавание отличается от обычной конвертации?
- Обычная конвертация переписывает текст, который в файле уже есть. В скане и фотографии текста нет — есть точки, из которых он складывается для глаза. Распознавание читает эти точки и превращает в буквы, поэтому результат зависит от качества снимка, а не только от формата.
- Нужно ли что-то включать?
- Нет. Отсутствие текстового слоя определяется само: если в PDF нечего извлекать, файл уходит в распознавание без отдельной кнопки.
- Что будет с перевёрнутой страницей?
- Она развернётся перед распознаванием, и каждая страница проверяется отдельно — в пачке сканов один перевёрнутый лист не потянет за собой остальные. Если определить положение уверенно не удалось, страница остаётся как есть: неверный поворот ровной страницы хуже, чем неповёрнутая кривая.
- На каких языках?
- Русский и английский одновременно, выбирать не нужно. Двуязычный документ распознаётся целиком.
- Распознаётся ли рукописный текст?
- Нет. Движок обучен на печатных шрифтах; рукописный и декоративные шрифты он читает плохо.
- Сколько страниц можно за раз?
- До 200. Ограничение не в объёме файла, а во времени: распознавание идёт по 300 точек на дюйм, и очень длинный скан не должен занимать обработчик дольше отведённого ему срока.
- Сохранится ли таблица из скана?
- Нет. Из растра восстанавливать нечего: распознанное ложится в документ обычным текстом — абзацы и страницы на месте, таблиц, колонок и картинок оригинала нет. Это свойство скана, а не ограничение сервиса. Если исходный PDF был сделан из документа, а не отснят, таблицы сохранятся — путь выбирается сам.
Распознавание бесплатно и без регистрации, как и остальная конвертация. Загруженные файлы и результаты удаляются автоматически — подробности в политике конфиденциальности.