Cum extragi textul dintr-un PDF

Conversia PDF textul este util pentru căutarea, cotarea, revizuirea accesibilității, luarea de note sau mutarea conținutului într-un alt sistem. Rezultatul depinde de ceea ce PDF conţine. Unele documente au un strat de text curat; altele stochează glifele într-o ordine confuză; paginile scanate pot conține doar imagini și nu pot fi extrase deloc.
HatchMyPDF citeste existenta PDF strat text cu PDF.js în browserul tău. Nu încarcă documentul sau trimite textul extras la analiză. Rezultatul este o previzualizare numai pentru citire cu Copiere toate și o UTF-8 TXT descărcare.
Pe scurt: PDF, introduceți parola dacă este necesar, selectați toate paginile sau o gamă, decideți dacă să păstrați separatoarele standard de pagini, extrageți secvențial, revizuiți previzualizarea și descărcați sau copiați textul.
Extracția textului nu este OCR
Un digital normal PDF conține adesea obiecte de text, precum și designul paginii vizuale. PDF.js poate expune aceste obiecte, coordonatele lor, direcția de scriere, și indicii linia-ending. Extractorul utilizează aceste informații pentru a adăuga spații rezonabile și pauze de linie.
O scanare numai imagine nu are un astfel de strat de text. Recunoașterea optică a caracterelor, sau OCR, ar trebui să analizeze pixeli pagină cu un model sau motor de recunoaștere. OCR este în afara versiunii 1. În cazul în care nu se găsește niciun text, instrumentul arată o stare de scanare distinctă, posibil, în loc de a returna o descărcare albă înșelătoare.
Dacă puteți selecta cuvinte într-un mod normal PDF Vizualizator, extragerea este mai probabil să funcționeze. Selecţia nu este o garanţie: codările personalizate, hărţile de caractere lipsă sau construcţia de fonturi neobişnuite pot produce încă text incomplet.
Pas cu pas: convertire PDF la TXT
- Deschide PDF la text și să aleagă PDF până la 50 MB şi 1.000 de pagini.
- Introduceți o parolă dacă PDF.js cere una. Parola rămâne în memorie și documentul sursă nu este modificat.
- Alegeți toate paginile sau introduceți o gamă cum ar fi
2-6,9. - Păstrați separatoarele standard de pagini activate atunci când software-ul din aval ar trebui să știe unde unul PDF Pagina se termină şi următorul începe.
- Începeţi extracţia. Paginile sunt citite secvenţial, iar procesul poate fi anulat între pagini.
- Revizuiți previzualizarea numai pentru citire. Copiază tot textul sau descarcă un UTF-8 TXT fișier cu un semn byte-order pentru compatibilitate editor larg.
<blog-post-cta type="pdfTraducerea şi adaptarea:/blog-post-cta>
Limitele paginii și caracterul de alimentare a formelor
În mod implicit, TXT Utilizări de ieșire pentru furaje U+000C între pagini. Form feed este un standard de control text simplu caracter asociat istoric cu o pauză de pagină. Mulţi editori îl afişează ca pe un alb-spaţiu sau ca pe un simbol special. HatchMyPDF arată un vizibil pauza de pataj separator în previzualizare în loc de expunerea unei zone neclare.
Dezactivează separatoarele de pagini atunci când rezultatul trebuie să se comporte ca un flux continuu de text. Instrumentul apoi unește pagini cu linii albe obișnuite. Orice alegere pierde geometria vizuală exactă a PDF pentru că TXT stochează caractere și pauze de linie, nu obiecte de pagină poziționate.
Rezultatul este limitat la 10 milioane de caractere sau 20 MB de UTF-8 date. Aceasta împiedică un strat de text neobişnuit de mare sau malformat să consume memorie nelegată a browser-ului. ă PDF limitele de intrare și de pagină se aplică încă separat.
Coloane, tabele și ordine de citire
PDF este un format de prezentare. O pagină poate desena coloana din dreapta înaintea coloanei din stânga, poate plasa fiecare literă separat sau poate poziţiona celulele din tabel fără o structură semantică a rândului. Rezultatul vizual poate părea corect în timp ce ordinea obiectului intern nu este o ordine de citire naturală.
Extractorul ia în considerare elemente text, hasEOL indicii, coordonate, spaţii şi direcţie de scriere. Acesta poate produce text simplu util pentru documente comune, inclusiv conţinutul de la dreapta la stânga, dar nu reconstruieşte un document Word, foaie de calcul sau etichetat accesibilPDF structura. Coloanele se pot intersecta, celulele de masă se pot aplatiza, iar antetele sau picioarele pot apărea în mijlocul unui pasaj copiat.
Pentru conservarea vizuală mai degrabă decât refolosirea textului, PDF în imagini exporta pagini redate. Imaginile păstrează aspectul, dar nu creează text editabil și nu trebuie confundate cu extracția.
Protejat PDFs şi intimitatea
Citirea unui document protejat nu îl schimbă, astfel încât instrumentul nu trebuie să re-cripteze o ieșire PDF. Parola este folosit pentru a deschide local PDF.js sesiune și este șters atunci când fișierul este eliminat sau pagina este închisă. Numele fișierelor, parolele, textele extrase, numărul paginilor, paginile selectate și conținutul documentelor sunt excluse din analiză.
Procesarea locală a browser-ului nu face ca fiecare clipboard sau destinație de descărcare să fie privată. După copierea textului, clipboard-ul sistemului de operare și orice aplicație în care lipești devine parte a fluxului de date. Salvează sensibil TXT fișiere numai la o locație adecvată.
Depanare
Instrumentul spune PDF poate fi o scanare
Deschideți fișierul într-un vizualizor și încercați să selectați cuvintele individuale. Dacă selecția atrage doar un dreptunghi pe întreaga pagină, pagina este probabil o imagine. OCR este necesar și nu este inclus în acest instrument.
Cuvintele circulă împreună sau au spații neașteptate
PDF Poziționarea textului nu înregistrează întotdeauna limite normale de cuvinte. Extractorul estimează spaţiile de la coordonatele elementului şi indiciile liniei. Fonturile personalizate sau glifele poziționate individual pot produce rezultate neobișnuite. Comparați citate importante cu sursa vizibilă.
Coloane sau tabele apar în ordinea greșită
Aceasta este o limitare a textului simplu și PDF Desenează ordinea. Extragerea unei game mai mici de pagini, copierea secțiunilor separat sau utilizarea unui tabel specializat/document fluxul de lucru de conversie atunci când structura contează.
Unele pagini sunt goale în timp ce altele lucrează
A PDF poate amesteca pagini digitale și imagini scanate. Extragetorul returnează textul paginilor cu un strat de text susţinut şi păstrează limitele paginii pentru rezultate în alb. Folosește Organizați paginile PDF atunci când paginile goale sau nedorite trebuie eliminate dintr-o copie de lucru separată înainte de extracție.
Revizuire înainte de reutilizare
Tratament extras TXT în calitate de reprezentare profesională, nu de înlocuire cu autoritate a PDF. Verificaţi numele, numerele, punctuaţia, ordinea de citire şi pagina de unde provine un citat. Păstrați originalul pentru context și utilizați separatoare de pagini atunci când trasabilitatea contează.