Как извлечь текст из PDF

Как извлечь текст из PDF

Преобразование a PDF Текст полезен для поиска, цитирования, обзора доступности, заметок или перемещения контента в другую систему. Результат зависит от того, какой PDF содержит. Некоторые документы имеют чистый текстовый слой; другие хранят глифы в запутанном порядке; отсканированные страницы могут содержать только изображения и вообще не извлекаемые символы.

HatchMyPDF Читать существующий PDF текстовый слой с PDF.js в вашем браузере. Он не загружает документ и не отправляет извлеченный текст в аналитику. Результатом является предварительный просмотр только для чтения с копированием всех и UTF-8 TXT скачать.

Вкратце: ** Выберите PDFВведите пароль, если это необходимо, выберите все страницы или диапазон, решите, следует ли хранить стандартные разделители страниц, извлекать последовательно, просматривать предварительный просмотр и загружать или копировать текст.

Извлечение текста не OCR

Обычный цифровой PDF Часто содержит текстовые объекты, а также визуальный дизайн страницы. PDF.js Они могут разоблачать эти объекты, их координаты, направление письма и бесконечные подсказки. Экстрактор использует эту информацию для добавления разумных пространств и разрывов линий.

Сканирование только изображения не имеет такого текстового слоя. Оптическое распознавание символов, или OCR, должно анализировать пиксели страниц с помощью модели или механизма распознавания. OCR выходит за пределы версии 1. Когда текст не найден, инструмент показывает четкое состояние «возможно, сканирования», а не возвращает вводящую в заблуждение пустую загрузку.

Если вы можете выбрать слова в обычном PDF Зритель, извлечение с большей вероятностью сработает. Выбор не является гарантией: пользовательские кодировки, отсутствующие карты символов или необычная конструкция шрифта все еще могут создавать неполный текст.

Шаг за шагом: конвертировать PDF то TXT

  1. Открыто!PDF В текстеPDF в текст и выбрать PDF до 50 МБ и 1000 страниц.
  2. Введите пароль, если PDF.js Запрашивает один. Пароль остается в памяти и исходный документ не изменяется.
  3. Выберите все страницы или введите диапазон, такой как 2-6,9.
  4. Держите стандартные разделители страниц включенными, когда программное обеспечение нисходящего потока должно знать, где PDF Страница заканчивается, а следующая начинается.
  5. Начинайте экстракцию. Страницы читаются последовательно, и процесс может быть отменен между страницами.
  6. Просмотрите только предварительный просмотр. Копировать весь текст или скачать UTF-8 TXT файл с отметкой байт-ордера для широкой совместимости редактора.

<blog-post-cta type="pdfToText>

Границы страниц и характер подачи формы

По умолчанию, TXT Производитель: Form Feed U+000C между страницами. Форм-канал - это стандартный символ управления простым текстом, исторически связанный с перерывом на странице. Многие редакторы отображают его как белое пространство или специальный символ. HatchMyPDF показывает видимый разделитель «Пейдж-брейк» в предварительном просмотре вместо того, чтобы обнажать двусмысленную пустую область.

Отключить разделители страниц, когда результат должен вести себя как один непрерывный текстовый поток. Затем инструмент соединяет страницы с обычными пустыми строками. Либо выбор теряет точную визуальную геометрию. PDF Потому что TXT хранит символы и разрывы линий, а не позиционированные объекты страницы.

Выход ограничен 10 миллионами символов или 20 МБ UTF-8 данные. Это предотвращает необычно большой или неправильно сформированный текстовый слой от потребления неограниченной памяти браузера. The PDF Ограничения ввода и страницы по-прежнему применяются отдельно.

Колонны, столы и порядок чтения

PDF Это формат презентации. Страница может рисовать правый столбец перед левым столбцом, помещать каждую букву отдельно или позиционировать ячейки таблицы без семантической структуры строки. Визуальный результат может выглядеть правильно, в то время как внутренний объектный порядок не является естественным порядком чтения.

Экстрактор рассматривает текстовые элементы, hasEOL подсказки, координаты, пространства и направление письма. Он может создавать полезный простой текст для общих документов, включая право-левый контент, но он не реконструирует документ Word, электронную таблицу или доступные теги.PDF структуры. Колонны могут переплетаться, ячейки стола могут сплющиваться, а заголовки или нижние колонны могут появляться в середине скопированного прохода.

Для визуального сохранения, а не для повторного использования текста, [PDF ИзображенияPDF в изображения экспортные страницы. Изображения сохраняют внешний вид, но не создают редактируемый текст и не следует путать с извлечением.

защищенный PDFs и конфиденциальность

Чтение защищенного документа не меняет его, поэтому инструменту не нужно повторно шифровать вывод PDF. Пароль используется для открытия локального PDF.js сеанс и очищается при удалении файла или закрытии страницы. Имена файлов, пароли, извлеченный текст, количество страниц, выбранные страницы и содержание документов исключены из аналитики.

Обработка в локальном браузере не делает каждый буфер обмена или пункт назначения загрузки приватным. После копирования текста буфер обмена операционной системы и любое приложение, в которое вы вставляете его, становятся частью потока данных. Сохранить чувствительные TXT Файлы только в соответствующее место.

устранение неполадок

Инструмент говорит, что PDF Может быть сканирование

Откройте файл в зрителе и попробуйте выбрать отдельные слова. Если выбор рисует только прямоугольник по всей странице, страница, вероятно, является изображением. OCR необходим и не включен в этот инструмент.

Слова работают вместе или имеют неожиданное пространство.

PDF Позиционирование текста не всегда записывает нормальные границы слов. Экстрактор оценивает пространства по координатам элементов и подсказкам линий. Пользовательские шрифты или индивидуально расположенные глифы все еще могут давать необычные результаты. Сравните важные цитаты с видимым источником.

Колонки или таблицы появляются в неправильном порядке

Это ограничение простого текста и PDF Приказ нарисовать. Извлеките меньший диапазон страниц, копируйте разделы отдельно или используйте специализированную таблицу./document Конверсия рабочего процесса, когда структура имеет значение.

Некоторые страницы пусты, а другие работают

А. PDF Может смешивать цифровые страницы и отсканированные изображения. Экстрактор возвращает текст для страниц с поддерживаемым текстовым слоем и сохраняет границы страниц для пустых результатов. Использование Организация страниц PDF когда пустые или нежелательные страницы должны быть удалены из отдельной рабочей копии до извлечения.

Перед повторным использованием

Извлеченное лечение TXT в качестве рабочего представительства, а не авторитетной замены PDF. Проверьте имена, цифры, пунктуацию, порядок чтения и страницу, где возникла цитата. Сохраняйте оригинал для контекста и используйте разделители страниц, когда важна прослеживаемость.