Извлеките текст из PDF
Извлеките текст из PDF и скачайте его как TXT или Word (.docx). PDF читается целиком внутри вашего браузера и никуда не загружается — это важно, когда документ является договором, резюме или счетом.
Что инструмент может и чего не может
PDF — формат верстки, а не документа: он хранит, где нарисован каждый символ, а не то, как устроен текст. Поэтому часть вещей работает надежно, а часть остается приблизительной.
- Текст восстанавливается по положению символов: строки группируются по вертикальному положению, затем упорядочиваются слева направо. Обычные одноколоночные документы выходят чисто.
- Многоколоночная верстка, таблицы, колонтитулы — приблизительны. Колонки могут перемешиваться, а ячейки таблиц теряют сетку, потому что эта структура никогда не хранилась в файле.
- В отсканированных PDF текста нет вовсе. Инструмент сообщит об этом вместо загрузки пустого файла, но прочитать их не сможет — нужен OCR.
- Форматирование не сохраняется. Полужирный, шрифты, размеры, цвета и изображения отбрасываются; остаются слова.
- PDF под паролем открыть нельзя, о чем сообщается отдельно.
- Ничего не загружается. PDF разбирает ваш собственный браузер, включая worker-файл парсера, который отдается с этого сайта, а не со сторонней CDN.
Частые вопросы
Загружается ли мой PDF на сервер?
Нет. PDF читает целиком ваш собственный браузер, а worker-файл парсера отдается с этого сайта, а не со сторонней CDN, поэтому открытие документа не создает запросов, уносящих ваш файл куда-либо. Это можно проверить, отключив сеть после загрузки страницы и извлекая текст.
Почему извлеченный текст пустой?
Почти наверняка потому, что PDF является сканом: страницы сохранены как изображения, и извлекать в файле нечего. Инструмент это определяет и сообщает вместо загрузки пустого файла. Для чтения скана нужен OCR — другая технология распознавания букв на изображении, и здесь она не используется.
Можно получить .doc вместо .docx?
Нет, и это осознанно. Старый .doc — устаревший бинарный формат времен Word 97, который неразумно синтезировать в браузере. Некоторые сервисы обходят это, переименовывая HTML в .doc, из-за чего файл искажает собственный формат и Word может выдать предупреждение. Здешний .docx — настоящий файл Word, он нормально открывается в Word, Google Документах, LibreOffice и Pages.
Почему порядок текста неправильный?
PDF записывает, где нарисован каждый символ, но не порядок чтения, поэтому порядок приходится восстанавливать по положению. Инструмент группирует символы в строки по вертикали и читает каждую строку слева направо, что хорошо работает для обычных документов. Двухколоночная верстка и таблицы — как раз тот случай, где это ломается, ведь в файле не осталось сведений, что это колонки или ячейки.
Сохраняется ли форматирование в DOCX?
Нет. Вы получаете текст абзацами — по одному на строку — без полужирного, шрифтов, размеров, цветов и изображений. Цель в том, чтобы достать слова из PDF в редактируемый вид, а не воссоздать исходный дизайн.
Какого размера PDF можно загрузить?
До 100МБ. Ограничение есть потому, что браузер держит в памяти весь файл и каждую разобранную страницу, а число страниц важнее размера: насыщенный текстом PDF на 5МБ может содержать тысячи страниц. Если ваш файл отклонен, разделите его на части.