Jak wyodrębnić tekst z PDF

Konwersja PDF tekst jest przydatny do wyszukiwania, cytowania, przeglądu dostępności, pobierania notatek lub przenoszenia treści do innego systemu. Wynik zależy od tego, co PDF zawiera. Niektóre dokumenty mają czystą warstwę tekstową; inne przechowują glify w zagmatwanej kolejności; zeskanowane strony mogą zawierać tylko obrazy i żadnych znaków ekstrakcyjnych.
HatchMyPDF odczytuje istniejący PDF warstwa tekstowa z PDF.js w twojej przeglądarce. Nie wysyła dokumentu ani nie wysyła ekstrahowanego tekstu do analityki. Rezultatem jest podgląd tylko read- z Kopiuj wszystko i UTF-8 TXT pobierz.
- W skrócie: * * wybierz PDF, wprowadzić swoje hasło w razie potrzeby, wybrać wszystkie strony lub zakres, zdecydować, czy zachować standardowe separatory strony, ekstrahować kolejno, przeglądać podgląd, i pobrać lub skopiować tekst.
Ekstrakcja tekstu nie jest OCR
Normalny cyfrowy PDF często zawiera obiekty tekstowe, jak również projekt strony wizualnej. PDF.js mogą ujawnić te obiekty, ich współrzędne, kierunek pisania i podpowiedzi. Ekstraktor wykorzystuje te informacje do dodawania rozsądnych spacji i przerw w linii.
Tylko skanowanie obrazu nie ma takiej warstwy tekstowej. Optyczne rozpoznawanie znaków, czyli OCR, musiałoby analizować piksele stron za pomocą modelu lub silnika rozpoznawczego. OCR jest poza wersją 1. Kiedy nie ma tekstu, narzędzie pokazuje odrębny stan "ewentualnie skanowanie" zamiast zwracania mylące puste pobieranie.
Jeśli możesz wybrać słowa w normalnym PDF Widz, ekstrakcja jest bardziej prawdopodobna. Wybór nie jest gwarancją: niestandardowe kodowanie, brakujące mapy znaków lub nietypowa konstrukcja czcionki może jeszcze produkować niekompletny tekst.
Krok-by@-@ krok: konwertuj PDF do TXT
- Otwórz PDF na tekst i wybrać PDF do 50 MB i 1000 stron.
- Wpisz hasło jeśli PDF.js Jeden wniosek. Hasło pozostaje w pamięci, a dokument źródłowy nie jest modyfikowany.
- Wybierz wszystkie strony lub wprowadź zakres, taki jak
2-6,9. - Keep standard page separatory włączone, gdy oprogramowanie niższego szczebla powinien wiedzieć, gdzie jeden PDF Strona się kończy, a następna się zaczyna.
- Rozpocząć ekstrakcję. Strony są czytane kolejno, a proces można anulować między stronami.
- Przejrzyj podgląd tylko do odczytu. Skopiuj cały tekst lub pobierz UTF-8 TXT plik ze znakiem byte- order dla szerokiej kompatybilności edytora.
< blog- post- cta type = "pdfToText ">
Granice stron i znak form- feed
Domyślnie TXT wyjście wykorzystuje formę paszy U+000C między stronami. Forma pasza jest standardowym znakiem kontroli tekstu zwykłego historycznie związane z przerwą na stronie. Wiele edytorów wyświetla go jako biały lub specjalny symbol, więc HatchMyPDF wyświetla widoczny w podglądzie dzielnik "Przerwa na stronie" zamiast odsłonić niejednoznaczne puste pole.
Wyłącz separatory stron, gdy wynik powinien zachowywać się jak jeden ciągły strumień tekstu. Następnie narzędzie łączy strony ze zwykłymi pustymi wierszami. Każdy wybór traci dokładną geometrię wizualną PDF ponieważ TXT przechowuje znaki i przerwy liniowe, nie umieszczane obiekty strony.
Wyjście jest ograniczone do 10 milionów znaków lub 20 MB UTF-8 dane. Zapobiega to nietypowo dużej lub zniekształconej warstwie tekstowej zużywającej nieograniczoną pamięć przeglądarki. W PDF limity wejścia i strony nadal obowiązują oddzielnie.
Kolumny, tabele i kolejność odczytów
PDF jest formatem prezentacji. Strona może narysować prawą kolumnę przed lewą kolumną, umieścić każdą literę oddzielnie, lub pozycji komórek tabeli bez struktury wiersza semantycznego. Wynik wizualny może wyglądać poprawnie, podczas gdy wewnętrzna kolejność obiektów nie jest naturalną kolejnością odczytu.
Ekstraktor bierze pod uwagę pozycje tekstowe, hasEOL wskazówki, współrzędne, przestrzenie i kierunek zapisu. Może tworzyć użyteczny, prosty tekst dla wspólnych dokumentów, w tym od prawej do lewej treści, ale nie rekonstruuje dokumentu Word, arkusza kalkulacyjnego lub dostępnych tagged-PDF struktury. Kolumny mogą się przecinać, komórki stołowe mogą spłaszczać, a nagłówki lub stopy mogą pojawiać się w środku kopiowanego przejścia.
Do konserwacji wizualnej zamiast ponownego użycia tekstu, PDF na obrazy strony eksportowe. Obrazy zachowują wygląd, ale nie tworzą edytowalnego tekstu i nie powinny być mylone z ekstrakcją.
Chronione PDFs i prywatność
Czytanie chronionego dokumentu nie zmienia go, więc narzędzie nie musi ponownie szyfrować wyjścia PDF. Hasło jest używane do otwarcia lokalnego PDF.js sesja i jest wyczyszczona po usunięciu pliku lub zamknięciu strony. Nazwy plików, hasła, ekstrahowany tekst, ilość stron, wybrane strony i zawartość dokumentu są wyłączone z analityki.
Browser- lokalne przetwarzanie nie czyni każdej schowka lub pobrać cel prywatny. Po skopiowaniu tekstu, schowek systemu operacyjnego i każda aplikacja, w której wklejasz go, stają się częścią przepływu danych. Zapisz wrażliwe TXT pliki tylko w odpowiednim miejscu.
Rozwiązywanie problemów
Narzędzie mówi: PDF może być skanowanie
Otwórz plik w przeglądarce i spróbuj wybrać pojedyncze słowa. Jeśli wybór rysuje tylko prostokąt na całej stronie, strona jest prawdopodobnie obrazem. OCR jest wymagane i nie jest zawarte w tym narzędziu.
Słowa biegną razem lub mają nieoczekiwane przestrzenie
PDF pozycjonowanie tekstu nie zawsze rejestruje normalne granice słowa. Ekstraktor szacuje miejsca na podstawie współrzędnych pozycji i podpowiedzi. Czcionki niestandardowe lub indywidualnie umieszczone glify mogą nadal powodować niezwykłe wyniki. Porównaj ważne notowania z widocznym źródłem.
Kolumny lub tabele pojawiają się w złej kolejności
Jest to ograniczenie zwykłego tekstu i PDF Kolejność rysowania. Wydrukuj mniejszy zakres stron, kopiuj sekcje oddzielnie, lub skorzystaj z specjalnej tabeli/document proces konwersji, gdy ma znaczenie struktura.
Niektóre strony są puste, podczas gdy inne działają
A PDF może mieszać strony cyfrowe i zeskanowane obrazy. Ekstraktor zwraca tekst dla stron z obsługiwaną warstwą tekstu i zachowuje granice dla pustych wyników. Użyj Organizuj strony PDF gdy puste lub niechciane strony powinny zostać usunięte z oddzielnej kopii roboczej przed ekstrakcją.
Przegląd przed ponownym użyciem
Wyekstrahowana trawa TXT jako przedstawicielstwo robocze, a nie autorytatywne zastępstwo PDF. Zweryfikuj nazwy, numery, interpunkcję, kolejność odczytów i stronę, z której pochodzi cytat. Zachować oryginał dla kontekstu i używać separatorów stron, gdy ma znaczenie identyfikowalność.