Обрабатывается на вашем устройстве — никуда не загружается

PDF в текст

Весь текст из PDF аккуратным .txt — извлекается мгновенно в вашем браузере. А если PDF окажется сканом, инструмент честно так и скажет, вместо того чтобы вручить пустой файл.

Перетащите PDF сюда или нажмите для выбора Нажмите, чтобы выбрать файл
PDF · текст извлекается локально · ничего не загружается

Мгновенный текст — или честное «это скан»

Если у вашего PDF есть текстовый слой — а он есть у всего, что экспортировано из Word, браузера, LaTeX или системы выставления счетов, — текст извлекается за мгновения, показывается прямо на странице и готов к копированию в буфер или скачиванию как .txt. Без похода на сервер и без тревоги за размер: после разовой загрузки движка (~5 МБ) всё работает на вашем устройстве.

А когда текстового слоя в PDF нет, инструмент поступает честно: говорит, что файл — это скан и ему нужен OCR (распознавание текста), вместо того чтобы вручить .txt в ноль байт и назвать это успехом. Смешанные документы тоже получают честность по страницам: если страницы 4 и 7 — сканы внутри цифрового файла, результат так и скажет.

Частые вопросы

Почему он пишет, что мой PDF — скан?
Потому что у него нет текстового слоя — страницы представляют собой фотографии текста, и извлекать нечего. Тут нужен OCR (распознавание текста), а это другая задача. Честное сообщение лучше пустого .txt.
Форматирование сохранится?
Извлекается простой текст в порядке чтения — заголовки, таблицы и вёрстка становятся обычными строками. Если нужно сохранить структуру, для этого есть «PDF в Markdown».
В выводе не хватает некоторых страниц — почему?
Строка статуса перечисляет ровно те страницы, которые оказались сканами без текстового слоя. Остальной документ извлекается нормально; отсканированным страницам сначала нужен OCR.

Похожие инструменты