Cara mengekstrak teks dari PDF

Mengkonversi a PDF ke teks berguna untuk pencarian, kutipan, tinjauan aksesibilitas, catatan-taking, atau memindahkan isi ke sistem lain. Hasilnya tergantung pada apa yang PDF mengandung. Beberapa dokumen memiliki lapisan teks yang bersih; lainnya menyimpan glyphs dalam urutan yang membingungkan; halaman yang dipindai mungkin hanya berisi gambar dan tidak ada karakter yang dapat diekstrak sama sekali.
HatchMyPDF membaca yang ada PDF text layer dengan PDF.js dalam browser Anda. Ini tidak mengunggah dokumen atau mengirim teks yang diekstrak untuk analisis. Hasilnya adalah pratinjau baca-saja dengan Salin semua dan sebuah UTF-8 TXT download.
- Singkatnya: * * memilih PDF, masukkan passwordnya jika diperlukan, pilih semua halaman atau kisaran, tentukan apakah menyimpan pemisah halaman standar, ekstrak secara berurutan, tinjau pratilik, dan unduh atau salin teks.
Ekstraksi teks bukan OCR
Sebuah digital normal PDF sering kali berisi objek teks serta desain halaman visual. PDF.js dapat mengekspos objek-objek, koordinat mereka, menulis arah, dan line- berakhir petunjuk. Ekstraksi menggunakan informasi tersebut untuk menambahkan ruang dan garis yang masuk akal.
Sebuah image- hanya memindai tidak memiliki lapisan teks tersebut. Pengenalan karakter optik, atau OCR, perlu menganalisis pixel halaman dengan mesin model atau pengenalan. OCR di luar versi 1. Ketika tidak ada teks yang ditemukan, alat ini menunjukkan keadaan "mungkin sebuah pemindaian" yang berbeda daripada mengembalikan unduhan kosong yang menyesatkan.
Jika Anda dapat memilih kata-kata dalam normal PDF Penlihat, ekstraksi lebih mungkin untuk bekerja. Pilihan bukan jaminan: pengkodean gubahan, peta karakter yang hilang, atau konstruksi fonta yang tidak biasa masih dapat menghasilkan teks yang tidak lengkap.
Langkah-demi-langkah: konversi PDF ke TXT
- Buka PDF ke Teks dan memilih PDF hingga 50 MB dan 1.000 halaman.
- Masukkan sandi jika PDF.js permintaan satu. Sandi tetap dalam memori dan dokumen sumber tidak diubah.
- Pilih semua halaman atau masukkan kisaran seperti
2-6,9. - Jaga pemisah halaman standar diaktifkan ketika perangkat lunak hilir harus tahu di mana satu PDF halaman berakhir dan berikutnya dimulai.
- Mulai ekstraksi. Halaman dibaca secara berurutan, dan proses dapat dibatalkan antara halaman.
- Tinjau pratinjau baca-saja. Salin semua teks atau unduh UTF-8 TXT berkas dengan tanda byte-order untuk kompatibilitas penyunting luas.
< blog -post-cta tipe = "pdfToText ">
Batas halaman dan karakter form-feed
Secara default, TXT keluaran menggunakan format feed U+000C antara halaman. Formulir feed adalah standar kontrol teks karakter historis diasosiasikan dengan istirahat halaman. Banyak editor menampilkan sebagai ruang putih atau simbol khusus, jadi HatchMyPDF menampilkan pembagi "page break" terlihat di pratilik daripada mengekspos area kosong ambigu.
Nonaktifkan pemisah halaman ketika hasil harus berperilaku sebagai satu aliran teks terus menerus. Alat ini kemudian bergabung dengan halaman kosong biasa. Entah pilihan kehilangan persis geometri visual dari PDF karena TXT simpan karakter dan baris istirahat, tidak memposisikan objek halaman.
Keluaran terbatas pada 10 juta karakter atau 20 MB dari UTF-8 data. Ini mencegah lapisan teks yang luar biasa besar atau cacat dari mengkonsumsi memori peramban yang tak terbatas. The PDF input dan batas halaman masih berlaku secara terpisah.
Kolom, tabel, dan urutan membaca
PDF adalah format presentasi. Sebuah halaman dapat menggambar kolom kanan sebelum kolom kiri, menempatkan setiap huruf secara terpisah, atau sel tabel posisi tanpa struktur baris semantik. Hasil visual mungkin terlihat benar sementara internal urutan objek bukan urutan pembacaan alami.
Extractor menganggap item teks, hasEOL petunjuk, koordinat, spasi, dan arah menulis. Ini dapat menghasilkan teks biasa yang berguna untuk dokumen umum, termasuk isi kanan ke kiri, tetapi tidak merekonstruksi dokumen Word, lembar kerja, atau akses tagge-PDF struktur. Kolom dapat berinterleave, sel tabel dapat meratakan, dan header atau footer mungkin muncul di tengah dari bagian yang disalin.
Untuk pelestarian visual daripada menggunakan kembali teks, PDF ke Gambar ekspor halaman yang diberikan. Gambar melestarikan penampilan tetapi tidak membuat teks yang dapat disunting dan tidak boleh bingung dengan ekstraksi.
Dilindungi PDFs dan privasi
Membaca dokumen yang dilindungi tidak mengubahnya, sehingga alat tidak perlu mengenkripsi ulang sebuah keluaran PDF. Sandi dipakai untuk membuka lokal PDF.js sesi dan dihapus ketika berkas dihapus atau halaman ditutup. Nama berkas, sandi, teks terekstrak, jumlah halaman, halaman terpilih, dan isi dokumen tidak termasuk dari analisis.
Pemrosesan lokal tidak membuat setiap papan klip atau mengunduh tujuan pribadi. Setelah menyalin teks, sistem operasi papan klip dan aplikasi mana pun di mana Anda menempelkannya menjadi bagian dari aliran data. Simpan sensitif TXT berkas hanya ke lokasi yang sesuai.
Penelusuran masalah
Alat mengatakan PDF mungkin sebuah pemindaian
Buka berkas dalam suatu penampil dan coba pilih kata individu. Jika pilihan hanya menggambar persegi panjang di seluruh halaman, halaman ini mungkin adalah gambar. OCR diperlukan dan tidak termasuk dalam alat ini.
Kata-kata berjalan bersama-sama atau memiliki ruang tak terduga
PDF teks posisi tidak selalu merekam batasan kata normal. Extractor memperkirakan ruang dari koordinat item dan petunjuk garis. Fonta kustom atau glyphs yang diposisikan sendiri masih dapat menghasilkan hasil yang tidak biasa. Bandingkan kutipan penting dengan sumber yang terlihat.
Kolom atau tabel muncul dalam urutan salah
Itu adalah keterbatasan teks polos dan PDF urutan gambar. Ekstrak kisaran halaman yang lebih kecil, bagian salinan secara terpisah, atau gunakan tabel khusus/document konversi alur kerja ketika struktur penting.
Beberapa halaman kosong sementara yang lain bekerja
A PDF dapat mencampur halaman digital dan memindai gambar. Ekstrator mengembalikan teks untuk halaman dengan lapisan teks yang didukung dan menjaga batas halaman untuk hasil kosong. Gunakan Atur Halaman PDF ketika halaman kosong atau tidak diinginkan harus dihapus dari salinan kerja terpisah sebelum ekstraksi.
Ulasan sebelum memakai ulang
Perlakuan diekstrak TXT sebagai representasi kerja, bukan sebuah otoritas pengganti untuk PDF. Verifikasi nama, nomor, tanda baca, urutan baca, dan halaman dimana kutipan berasal. Pertahankan yang asli untuk konteks dan gunakan pemisah halaman ketika traceabilitas penting.