Перейти к содержанию
Бесплатный инструмент

Извлеките текст из PDF

Извлеките текст из PDF и скачайте его как TXT или Word (.docx). PDF читается целиком внутри вашего браузера и никуда не загружается — это важно, когда документ является договором, резюме или счетом.

Перетащите PDF сюда
или нажмите для выбора (.pdf)

Что инструмент может и чего не может

PDF — формат верстки, а не документа: он хранит, где нарисован каждый символ, а не то, как устроен текст. Поэтому часть вещей работает надежно, а часть остается приблизительной.

  • Текст восстанавливается по положению символов: строки группируются по вертикальному положению, затем упорядочиваются слева направо. Обычные одноколоночные документы выходят чисто.
  • Многоколоночная верстка, таблицы, колонтитулы — приблизительны. Колонки могут перемешиваться, а ячейки таблиц теряют сетку, потому что эта структура никогда не хранилась в файле.
  • В отсканированных PDF текста нет вовсе. Инструмент сообщит об этом вместо загрузки пустого файла, но прочитать их не сможет — нужен OCR.
  • Форматирование не сохраняется. Полужирный, шрифты, размеры, цвета и изображения отбрасываются; остаются слова.
  • PDF под паролем открыть нельзя, о чем сообщается отдельно.
  • Ничего не загружается. PDF разбирает ваш собственный браузер, включая worker-файл парсера, который отдается с этого сайта, а не со сторонней CDN.

Частые вопросы

Загружается ли мой PDF на сервер?

Нет. PDF читает целиком ваш собственный браузер, а worker-файл парсера отдается с этого сайта, а не со сторонней CDN, поэтому открытие документа не создает запросов, уносящих ваш файл куда-либо. Это можно проверить, отключив сеть после загрузки страницы и извлекая текст.

Почему извлеченный текст пустой?

Почти наверняка потому, что PDF является сканом: страницы сохранены как изображения, и извлекать в файле нечего. Инструмент это определяет и сообщает вместо загрузки пустого файла. Для чтения скана нужен OCR — другая технология распознавания букв на изображении, и здесь она не используется.

Можно получить .doc вместо .docx?

Нет, и это осознанно. Старый .doc — устаревший бинарный формат времен Word 97, который неразумно синтезировать в браузере. Некоторые сервисы обходят это, переименовывая HTML в .doc, из-за чего файл искажает собственный формат и Word может выдать предупреждение. Здешний .docx — настоящий файл Word, он нормально открывается в Word, Google Документах, LibreOffice и Pages.

Почему порядок текста неправильный?

PDF записывает, где нарисован каждый символ, но не порядок чтения, поэтому порядок приходится восстанавливать по положению. Инструмент группирует символы в строки по вертикали и читает каждую строку слева направо, что хорошо работает для обычных документов. Двухколоночная верстка и таблицы — как раз тот случай, где это ломается, ведь в файле не осталось сведений, что это колонки или ячейки.

Сохраняется ли форматирование в DOCX?

Нет. Вы получаете текст абзацами — по одному на строку — без полужирного, шрифтов, размеров, цветов и изображений. Цель в том, чтобы достать слова из PDF в редактируемый вид, а не воссоздать исходный дизайн.

Какого размера PDF можно загрузить?

До 100МБ. Ограничение есть потому, что браузер держит в памяти весь файл и каждую разобранную страницу, а число страниц важнее размера: насыщенный текстом PDF на 5МБ может содержать тысячи страниц. Если ваш файл отклонен, разделите его на части.

Реклама