So extrahieren Sie Text aus einer PDF

So extrahieren Sie Text aus einer PDF

Umsetzen von a PDF Text ist nützlich für die Suche, das Zitat, die Überprüfung der Zugänglichkeit, die Notizaufnahme oder das Verschieben von Inhalten in ein anderes System. Das Ergebnis hängt davon ab, was die PDF enthält. Einige Dokumente haben eine saubere Textschicht; andere speichern Glyphen in einer verwirrenden Reihenfolge; gescannte Seiten können nur Bilder und keine extrahierbaren Zeichen enthalten.

HatchMyPDF Lesen Sie die bestehende PDF Textschicht mit PDF.js In Ihrem Browser. Es lädt das Dokument nicht hoch oder sendet extrahierten Text nicht an Analytics. Das Ergebnis ist eine Read-Only-Vorschau mit Copy all und einem UTF-8 TXT Download.

Kurz gesagt: Wählen Sie eine PDF, geben Sie bei Bedarf sein Passwort ein, wählen Sie alle Seiten oder einen Bereich aus, entscheiden Sie, ob Sie Standardseitentrennzeichen beibehalten, sequentiell extrahieren, die Vorschau überprüfen und den Text herunterladen oder kopieren möchten.

Textextraktion ist nicht OCR

Eine normale digitale PDF enthält häufig Textobjekte sowie das visuelle Seitendesign. PDF.js können diese Objekte, ihre Koordinaten, Schreibrichtung und Zeilenendhinweise belichten. Der Extraktor verwendet diese Informationen, um vernünftige Leerzeichen und Linienumbrüche hinzuzufügen.

Ein Nur-Bild-Scan hat keine solche Textschicht. Optische Zeichenerkennung oder OCR müsste Seitenpixel mit einem Modell oder einer Erkennungsmaschine analysieren. OCR steht außerhalb von Version 1. Wenn kein text gefunden wird, zeigt das tool einen eindeutigen "möglicherweise einen scan" -zustand an, anstatt einen irreführenden leeren download zurückzugeben.

Wenn Sie Wörter in einer normalen PDF Viewer, Extraktion ist eher zu arbeiten. Die Auswahl ist keine Garantie: Benutzerdefinierte Codierungen, fehlende Charakterkarten oder ungewöhnliche Schriftkonstruktionen können immer noch unvollständigen Text erzeugen.

Schritt für Schritt: konvertieren PDF bis TXT

  1. GeöffnetPDF zum TextPDF zum Text und wählen eine PDF bis zu 50 MB und 1.000 Seiten.
  2. Geben Sie ein Passwort ein, wenn PDF.js verlangt eine. Das Passwort bleibt im Speicher und das Quelldokument wird nicht geändert.
  3. Wählen Sie alle Seiten oder geben Sie einen Bereich wie 2-6,9.
  4. Halten Sie Standardseitentrenner aktiviert, wenn nachgelagerte Software wissen sollte, wo PDF Die Seite endet und die nächste beginnt.
  5. Extraktion starten. Seiten werden sequentiell gelesen, und der Prozess kann zwischen den Seiten abgebrochen werden.
  6. Überprüfen Sie die Read-Only Preview. Kopieren Sie alle Texte oder laden Sie eine UTF-8 TXT Datei mit einer Byte-Order-Markierung für eine breite Editor-Kompatibilität.

<blog-post-cta type=""pdfToText>

Seitengrenzen und Form-Feed-Zeichen

Standardmäßig ist die TXT Output verwendet Form Feed U+000C zwischen den Seiten. Formular-Feed ist ein Standard-Kleintext-Steuerzeichen, das historisch mit einem Seitenumbruch verbunden ist. Viele Editoren zeigen es als Whitespace oder ein spezielles Symbol an, also HatchMyPDF zeigt einen sichtbaren "Page Break"-Teiler in der Vorschau, anstatt einen mehrdeutigen leeren Bereich freizulegen.

Deaktivieren Sie Seitentrennzeichen, wenn sich das Ergebnis wie ein kontinuierlicher Textstrom verhalten soll. Das Tool verbindet dann Seiten mit gewöhnlichen leeren Linien. Jede Wahl verliert die genaue visuelle Geometrie des PDF weil TXT speichert Zeichen und Zeilenumbrüche, nicht positionierte Seitenobjekte.

Die Ausgabe ist auf 10 Millionen Zeichen oder 20 MB von UTF-8 Daten. Dies verhindert, dass eine ungewöhnlich große oder fehlerhafte Textschicht unbegrenzten Browserspeicher verbraucht. Die PDF Eingabe- und Seitenlimits gelten weiterhin separat.

Spalten, Tabellen und Lesereihenfolge

PDF ist ein Präsentationsformat. Eine Seite kann die rechte Spalte vor der linken Spalte zeichnen, jeden Buchstaben separat platzieren oder Tabellenzellen ohne semantische Zeilenstruktur positionieren. Das visuelle Ergebnis kann korrekt aussehen, während die interne Objektreihenfolge keine natürliche Lesereihenfolge ist.

Der Extraktor betrachtet Textelemente, hasEOL Hinweise, Koordinaten, Leerzeichen und Schreibrichtung. Es kann nützlichen Klartext für gängige Dokumente erstellen, einschließlich rechts-nach-links-Inhalten, aber es rekonstruiert kein Word-Dokument, keine Tabellenkalkulation oder keine barrierefreien Tags.PDF Struktur. Spalten können verschachtelt werden, Tabellenzellen können sich abflachen, und Kopf- oder Fußzeilen können in der Mitte einer kopierten Passage erscheinen.

Für visuelle Konservierung statt Textwiederverwendung, PDF zu BildernExportiert gerenderte Seiten. Bilder bewahren das Aussehen, erstellen jedoch keinen editierbaren Text und sollten nicht mit Extraktion verwechselt werden.

Geschützt PDFs und Privatsphäre

Das Lesen eines geschützten Dokuments ändert es nicht, so dass das Tool eine Ausgabe nicht neu verschlüsseln muss PDF. Das Passwort wird verwendet, um den lokalen PDF.js Sitzung und wird gelöscht, wenn die Datei entfernt oder die Seite geschlossen wird. Dateinamen, Passwörter, extrahierter Text, Seitenanzahl, ausgewählte Seiten und Dokumentinhalte sind von der Analyse ausgeschlossen.

Browser-lokale Verarbeitung macht nicht jede Zwischenablage oder Download-Ziel privat. Nach dem Kopieren von Text werden die Betriebssystem-Zwischenablage und jede Anwendung, in der Sie sie einfügen, Teil des Datenflusses. Save sensitive TXT Dateien nur an einem geeigneten Ort.

Fehlerbehebung

Das Tool sagt: PDF Kann ein Scan sein

Öffnen Sie die Datei in einem Viewer und versuchen Sie, einzelne Wörter auszuwählen. Wenn die Auswahl nur ein Rechteck über die ganze Seite zeichnet, ist die Seite wahrscheinlich ein Bild. OCR ist erforderlich und nicht in diesem Tool enthalten.

Wörter laufen zusammen oder haben unerwartete Räume

PDF Die Textpositionierung zeichnet nicht immer normale Wortgrenzen auf. Der Extraktor schätzt Leerzeichen aus Objektkoordinaten und Linienhinweisen. Benutzerdefinierte Schriften oder individuell positionierte Glyphen können immer noch ungewöhnliche Ergebnisse liefern. Vergleichen Sie wichtige Zitate mit der sichtbaren Quelle.

Spalten oder Tabellen erscheinen in der falschen Reihenfolge

Das ist eine Einschränkung des Klartextes und PDF Zeichenfolge. Extrahieren Sie einen kleineren Seitenbereich, kopieren Sie Abschnitte separat oder verwenden Sie eine spezielle Tabelle/document Conversion Workflow, wenn Struktur wichtig ist.

Einige Seiten sind leer, während andere arbeiten

A PDF können digitale Seiten und gescannte Bilder mischen. Der Extraktor gibt Text für Seiten mit einer unterstützten Textschicht zurück und behält Seitengrenzen für leere Ergebnisse. Verwenden Organisieren PDF Seiten, wenn leere oder unerwünschte Seiten vor der Extraktion aus einer separaten Arbeitskopie entfernt werden sollten.

Überprüfung vor Wiederverwendung

Ausgezogene Behandlung TXT als Arbeitsvertretung, nicht als autoritativer Ersatz für die PDF. Überprüfen Sie Namen, Zahlen, Interpunktion, Lesereihenfolge und die Seite, auf der ein Zitat entstanden ist. Bewahren Sie das Original für den Kontext auf und verwenden Sie Seitentrennzeichen, wenn die Rückverfolgbarkeit wichtig ist.