Конвертировать PDF в DOCX (Word) онлайн
Превращаем PDF в редактируемый документ Word: текст остаётся текстом, таблицы — таблицами, картинки встают на свои места.
Положите файл сюда
или нажмите, чтобы выбрать — до 15 МБ, видео — до 200 МБ
Подписка поднимает пределы — до 300 МБ, видео до 1 ГБ и 20 файлов за раз на Ultra. Подробнее
Как это происходит
PDF разбирается библиотекой pdf2docx: она читает координаты каждого текстового блока, определяет строки и абзацы, распознаёт границы таблиц и собирает из этого документ Word. Это не «вставка картинки в docx» — на выходе настоящий текст, который редактируется, ищется и копируется.
Если в PDF нет текстового слоя — а так выглядит любой скан или фотография страницы, — конвертация не останавливается. Файл уходит в распознавание: Tesseract с русским и английским словарями обрабатывает страницы параллельно и возвращает текст, который затем складывается в документ. Отдельно нажимать ничего не нужно, отсутствие текстового слоя определяется само.
Положение страницы тоже определяется само, причём для каждой отдельно: лист, отсканированный вверх ногами или боком, разворачивается перед распознаванием. В пачке сканов один поехавший лист не потянет за собой остальные.
Что переносится, а что поедет
Переносится хорошо: сплошной текст с абзацами, простые таблицы с видимыми границами, встроенные изображения, начертания и размеры шрифта.
Поедет: вёрстка в две и больше колонок — pdf2docx выстраивает блоки в один поток, и колонки идут друг за другом, а не рядом. Подписи под картинками часто становятся отдельными абзацами. Сложные таблицы с объединёнными ячейками и таблицы без линий распознаются неточно. Колонтитулы могут попасть в основной текст.
У скана путь другой и результат скромнее: из растра восстанавливать нечего, поэтому распознанное ложится в документ обычным текстом — абзацы и страницы на месте, таблицы, колонки и картинки оригинала нет. Это не наше ограничение, а свойство скана: в нём нет ничего, кроме точек. Если исходный PDF был сделан из документа, а не отснят, всё это сохранится — путь через pdf2docx выбирается сам.
Правило простое: чем ближе PDF к обычному текстовому документу, тем точнее результат. Журнальный разворот с колонками и врезками придётся править руками — но править готовый текст всё равно быстрее, чем набирать заново.
Если результат оказался пустым
Пустой или почти пустой документ означает одно из двух: в PDF нет текстового слоя и распознавание не нашло знакомых букв, либо страница защищена от извлечения текста. В первом случае помогает скан лучшего качества — распознавание плохо работает с перекошенными и размытыми снимками. Во втором конвертация невозможна в принципе, и никакой онлайн-сервис этого не обойдёт.
Частые вопросы
- Сохранится ли форматирование?
- Текст, абзацы, начертания, простые таблицы и картинки — да. Многоколоночная вёрстка, объединённые ячейки и колонтитулы переносятся неточно и требуют правки.
- Что будет со сканом без текстового слоя?
- Он распознаётся автоматически: Tesseract с русским и английским словарями, до 200 страниц за раз. Отдельно включать распознавание не нужно.
- Можно ли получить из PDF файл ODT, RTF или XLSX?
- Нет. PDF импортируется в графический редактор LibreOffice Draw, а он не экспортирует форматы Writer и Calc. Обходной путь один: сначала PDF → DOCX, потом DOCX в нужный формат.
Как конвертировать PDF в DOCX (Word)
- 1.Выберите файл PDF или перетащите его в окно.
- 2.Укажите DOCX в списке форматов.
- 3.Нажмите «Преврати» и скачайте результат.